跳到正文
热点事件持续更新

SDPO持续后训练研究:自蒸馏易遗忘

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

一项由Meng Wang等作者发表的研究重新审视了在线自蒸馏可缓解遗忘的乐观主张。实验显示,自蒸馏策略优化(SDPO)在教师信号稳定且对齐良好时能加速域内专精,但难以泛化到分布外。 在持续后训练中,SDPO的遗忘更严重甚至崩溃,而GRPO适应更保守、更好保留原有能力。研究将原因归于参数与响应空间漂移加剧,以及师生自强化循环放大高频伪影,结论是仅靠在线数据不足以支撑持续学习。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    密度不等于更好:持续后训练中在线自蒸馏的局限

    研究通过自蒸馏策略优化(SDPO)重新审视在线学习可缓解遗忘的乐观主张:SDPO 在教师信号稳定对齐时能加速域内专精,但难以泛化到分布外。在持续后训练中,SDPO 遗忘更严重甚至崩溃,而 GRPO 适应更保守、更好保留原有能力。分析将其归因于参数与响应空间漂移加剧,以及师生自强化循环放大高频伪影,说明仅靠在线数据不足以支撑持续学习。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。