跳到正文
原文
Thinking Machines Lab:官方博客(RSS)·· 2025-10-27精选AI 评分64

Thinking Machines Lab 发布 On-Policy Distillation 方法:以更低成本逼近 RL 训练效果

On-Policy Distillation

AI 导读

Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。

推荐理由

文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。

来源:Thinking Machines Lab:官方博客(RSS) · thinkingmachines.ai