跳到正文
热点事件持续更新

Muon有限步正交化获训练损失保证

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

针对 Muon 收敛性分析此前只保证稳定点、且假设精确正交化的问题,研究者 Amartya Roy 与 Souvik Chakraborty 发表论文,给出了计入动量累积与调优有限步更新的有限时间训练损失保证。 在足够宽的两层 ReLU 网络全批量训练下,该论文称 Muon 能以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),所需宽度与目标精度和动量无关。数值实验中,六个宽度、五种学生初始化共 30 次运行均达到目标损失并保持核正定性。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    Muon 有限步 Newton–Schulz 正交化的训练损失保证

    针对 Muon 收敛性分析此前只保证稳定点、且假设精确正交化的问题,研究者给出了计入动量累积与调优有限步更新的有限时间训练保证。在足够宽的两层 ReLU 网络全批量训练下,Muon 能以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),所需宽度与目标精度和动量无关。数值实验中,六个宽度、五种学生初始化共 30 次运行均达到目标损失并保持核正定性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。