研究提出 chained LMOs 框架与 TensorChain 优化器
热点事件持续更新
研究提出 chained LMOs 框架与 TensorChain 优化器
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Sungyoon Kim 等作者提出 chained LMOs 框架,将 Muon 等由多重矩阵归一化组合而成的优化器统一表示为线性最小化 oracle 的组合形式。基于该框架提出的 TensorChain 跨层堆叠兼容权重矩阵,并对 3d 张量沿各轴归一化。 作者称,在 Qwen3 0.6B 和 1.7B 预训练中,TensorChain 的平均 token 效率优于所有链式基线,在匹配验证损失下比 Muon 平均节省 9.6% token。
AI 根据报道生成 · 1 小时前更新
最新进展10月9日 12:00
用链式 LMO 优化大语言模型:TensorChain 提出并在 Qwen3 预训练上超越 Muon报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.AI用链式 LMO 优化大语言模型:TensorChain 提出并在 Qwen3 预训练上超越 Muon
研究提出 chained LMOs 框架,将 Muon 等由多重矩阵归一化组合而成的优化器统一为线性最小化 oracle 的组合形式。基于该框架提出的优化器 TensorChain 跨层堆叠兼容权重矩阵并对 3d 张量沿各轴归一化,在 Qwen3 0.6B 和 1.7B 预训练中平均 token 效率优于所有链式基线,在匹配验证损失下比 Muon 平均节省 9.6% token。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。