跳到正文
热点事件持续更新

Muon训练Transformer表征-读出界面崩塌研究

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Muon 训练的模算术 Transformer 在训练后期会出现准确率崩塌,但任务信息仍保留在线性可解码的表征中。作者 Ali Janati、Kaoutar El Maghraoui、Anass Belfatmi 在论文修订版中称,崩塌源于 AdamW 读出更新的未归一化失败。 他们将实际读出位移乘以较大的特征均值,会产生跨输入共享的类别相关 logit 偏移,可几乎复现每个崩塌案例;用仅训练集训练的解码器能恢复 98.20–100% 的留出准确率,修正交叉熵导数误差可让五个匹配分支稳定至第 100,000 步。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    Muon 训练的 Transformer 在表征-读出接口处的 Post-Grokking 崩塌

    Muon 训练的模算术 Transformer 会在保留线性可解码任务信息的同时丢失准确率,相邻交换将五个未归一化失败定位到 AdamW 读出更新。将实际读出位移乘以较大的特征均值会产生跨输入共享的类别相关 logit 偏移,几乎复现每个失败。仅用训练集训练的解码器可恢复 98.20-100% 的留出准确率;修正交叉熵导数误差可使五个匹配分支稳定至第 100,000 步。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。