跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 7 小时前AI 评分44

同族模型在线策略蒸馏的缩放规律研究

Scaling Properties of Same-Family On-Policy Distillation

AI 导读

研究揭示在线策略蒸馏(OPD)在弱到强、同基座和强到弱师生设置下的缩放规律:早期训练中,留出准确率(gold score)随学生初始化 token 级反向 KL 散度的平方根近似线性上升。

来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co