New Anthropic research: Natural emergent misalignment from reward hacking in production RL. “Reward hacking” is where models learn to cheat on tasks they’re given during training. Our new study finds that the consequences of reward hacking, if unmitigated, can be very serious.
#数据/训练
#数据/训练
今日 4 条
Ilya Sutskever@ilyasutAI 评分6060引用Anthropic@AnthropicAI
BAIR:Berkeley AI Research BlogAI 评分4747 无需 TD 学习的强化学习:用分治法扩展 off-policy RL
伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。
Thinking Machines Lab:官方博客(RSS)精选AI 评分6464 Thinking Machines Lab 发布 On-Policy Distillation 方法:以更低成本逼近 RL 训练效果
Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。
推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。
Thinking Machines Lab:官方博客(RSS)AI 评分4545 Thinking Machines Lab 提出模块化流形与流形版 Muon 优化器
Thinking Machines Lab 提出将神经网络各层权重约束在子流形上的思路,并给出权重约束在 Stiefel 流形(条件数为 1 的矩阵流形)上的流形版 Muon 优化器,该工作基于 Jianlin Su 与 Franz Louis Cesista 的研究。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大型网络的扩展与训练更容易,并希望社区在文末列出的方向上继续推进。
上海人工智能实验室 InternLM:原创项目AI 评分2323 InternLM 推出 AdaptiveGEMM:适配多种 Group M 长度的 FP8 GEMM
上海人工智能实验室 InternLM 项目发布 AdaptiveGEMM,一种可适配不同 Group M 长度的 FP8 GEMM 实现。该工作针对分组矩阵乘法中 Group M 长度多变的情况做自适应处理,属于底层算子层面的优化。
BAIR:Berkeley AI Research BlogAI 评分5050 word2vec 究竟学到了什么?BAIR 给出闭式学习理论
BAIR 新论文证明,在若干温和近似下 word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即目标矩阵 M* 的顶部特征向量,可由语料统计与超参数预先算出。
Mistral AI:News(网页)精选AI 评分6161 Mistral AI 发布 Mistral Large 2 全生命周期环境影响分析
Mistral AI 联合 Carbone 4 和 ADEME 完成 AI 模型首个综合生命周期分析(LCA),并经 Resilio 和 Hubblo 同行评审。
推荐理由:原文给出了 Mistral Large 2 全生命周期的具体碳、水和资源消耗数字,并说明其对选型与采购的意义。
OpenAI Developers(RSS)AI 评分1717 OpenAI DevDay 蒸馏专场:模型蒸馏策略解析
OpenAI DevDay 举办蒸馏(distillation)专题活动,讨论高效蒸馏模型的策略。内容聚焦蒸馏方法本身,未披露具体模型、参数规模或基准数据。
上海人工智能实验室 InternLM:原创项目AI 评分3535 InternLM 推出 POLAR:基于策略判别学习的预训练可扩展高性能奖励模型
上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。