跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Di Huang, Hao Li, Yixin Chen, Fuhai Li·· 3 小时前AI 评分39

当裁剪反转纠正:pointwise forward-KL 在线自蒸馏的失效动力学

When Clipping Reverses Correction: Failure Dynamics of Pointwise Forward-KL On-Policy Self-Distillation

AI 导读

在匹配训练条件下,对 forward KL 目标做 pointwise 裁剪的在线自蒸馏(OPSD)训练会产生明显更多、且持续到回答末尾的重复,而未裁剪版本则不会。作者证明裁剪后的目标可能无法把学生模型纠正向教师模型,反而将裁剪与未裁剪 token 的概率都推离教师;训练中裁剪版学生在重复片段内离开重复的概率低于教师、继续重复的概率高于教师。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org