Thinking Machines Lab:官方博客(RSS)·· 2025-10-27精选AI 评分64
Thinking Machines Lab 发布 On-Policy Distillation 方法:以更低成本逼近 RL 训练效果
On-Policy Distillation
AI 导读
Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。
推荐理由
文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。
来源:Thinking Machines Lab:官方博客(RSS) · thinkingmachines.ai