Muon有限步正交化获训练损失保证
热点事件持续更新
Muon有限步正交化获训练损失保证
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
针对 Muon 收敛性分析此前只保证稳定点、且假设精确正交化的问题,研究者 Amartya Roy 与 Souvik Chakraborty 发表论文,给出了计入动量累积与调优有限步更新的有限时间训练损失保证。 在足够宽的两层 ReLU 网络全批量训练下,该论文称 Muon 能以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),所需宽度与目标精度和动量无关。数值实验中,六个宽度、五种学生初始化共 30 次运行均达到目标损失并保持核正定性。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
Muon 有限步 Newton–Schulz 正交化的训练损失保证报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LGMuon 有限步 Newton–Schulz 正交化的训练损失保证
针对 Muon 收敛性分析此前只保证稳定点、且假设精确正交化的问题,研究者给出了计入动量累积与调优有限步更新的有限时间训练保证。在足够宽的两层 ReLU 网络全批量训练下,Muon 能以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),所需宽度与目标精度和动量无关。数值实验中,六个宽度、五种学生初始化共 30 次运行均达到目标损失并保持核正定性。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。