Muon训练Transformer表征-读出界面崩塌研究
热点事件持续更新
Muon训练Transformer表征-读出界面崩塌研究
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Muon 训练的模算术 Transformer 在训练后期会出现准确率崩塌,但任务信息仍保留在线性可解码的表征中。作者 Ali Janati、Kaoutar El Maghraoui、Anass Belfatmi 在论文修订版中称,崩塌源于 AdamW 读出更新的未归一化失败。 他们将实际读出位移乘以较大的特征均值,会产生跨输入共享的类别相关 logit 偏移,可几乎复现每个崩塌案例;用仅训练集训练的解码器能恢复 98.20–100% 的留出准确率,修正交叉熵导数误差可让五个匹配分支稳定至第 100,000 步。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
Muon 训练的 Transformer 在表征-读出接口处的 Post-Grokking 崩塌报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGMuon 训练的 Transformer 在表征-读出接口处的 Post-Grokking 崩塌
Muon 训练的模算术 Transformer 会在保留线性可解码任务信息的同时丢失准确率,相邻交换将五个未归一化失败定位到 AdamW 读出更新。将实际读出位移乘以较大的特征均值会产生跨输入共享的类别相关 logit 偏移,几乎复现每个失败。仅用训练集训练的解码器可恢复 98.20-100% 的留出准确率;修正交叉熵导数误差可使五个匹配分支稳定至第 100,000 步。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。