HuggingFace Daily Papers(社区热门论文)·· 1 小时前AI 评分33
并非每个 Token 都值得蒸馏:Direct-OPD 的选择性监督方法 S²D-OPD
Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD
AI 导读
针对 Direct-OPD 用 token 级对数比做稠密监督的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复仅保留前 10% 状态。在 1.7B 至 8B 的四个学生模型、两组教师模型上,该方法在 AIME 和 HMMT 基准的八种设置中有七种超越稠密 Direct-OPD,另一种持平,且无需额外前向计算。
来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co