跳到正文
原文
arXiv:cs.LG(机器学习,全量分类)· Akash Kumar·· 1 天前AI 评分37

表征学习能否脱离损失最小化?Muon 的极坐标更新给出答案

Can Representation Learning Decouple from Loss Minimization? Polar Updates Have an Answer

AI 导读

研究显示,矩阵 Muon 的极坐标归一化更新步长由梯度秩而非范数决定,在稳定性边缘会进入持续数千步的周期-2 损失振荡:周期均值损失持平或上升,但权重仍在移动、学到的特征持续对齐教师子空间。在 33 组 ReLU、GELU 和 SiLU 教师配置中,学生 AGOP 在振荡期间始终对齐或持续对齐教师子空间,投影头重拟合表明这些方向对预测有用。

来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org