SDPO持续后训练研究:自蒸馏易遗忘
热点事件持续更新
SDPO持续后训练研究:自蒸馏易遗忘
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
一项由Meng Wang等作者发表的研究重新审视了在线自蒸馏可缓解遗忘的乐观主张。实验显示,自蒸馏策略优化(SDPO)在教师信号稳定且对齐良好时能加速域内专精,但难以泛化到分布外。 在持续后训练中,SDPO的遗忘更严重甚至崩溃,而GRPO适应更保守、更好保留原有能力。研究将原因归于参数与响应空间漂移加剧,以及师生自强化循环放大高频伪影,结论是仅靠在线数据不足以支撑持续学习。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
密度不等于更好:持续后训练中在线自蒸馏的局限报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LG密度不等于更好:持续后训练中在线自蒸馏的局限
研究通过自蒸馏策略优化(SDPO)重新审视在线学习可缓解遗忘的乐观主张:SDPO 在教师信号稳定对齐时能加速域内专精,但难以泛化到分布外。在持续后训练中,SDPO 遗忘更严重甚至崩溃,而 GRPO 适应更保守、更好保留原有能力。分析将其归因于参数与响应空间漂移加剧,以及师生自强化循环放大高频伪影,说明仅靠在线数据不足以支撑持续学习。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。