HuggingFace Daily Papers(社区热门论文)·· 1 小时前AI 评分36
DuoOPD:基于师生联合结果的多任务在线策略蒸馏
DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation
AI 导读
DuoOPD 提出一种多任务在线策略蒸馏方法,由学生结果决定反馈方向、师生联合结果决定教师如何支持:仅教师答对时用其答案作为评分上下文,仅学生答对时按任务内共享权重强化整个回答。在 Qwen3 和 Llama 上,其平均宏准确率超越全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令遵循与代码生成等任务混合上领先。消融显示,联合结果设计贡献了主要增益。
来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co