跳到正文
热点事件持续更新

Δ-MOPD 多教师在线蒸馏方法提出

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Hejian Sang 等研究者提出 Δ-MOPD 多教师在线蒸馏方法:不直接迁移各教师的端点策略,而是把每位教师“教师减基座”的 logit 偏移重新锚定在学生冻结初始化上,再迁移给学生。 在三教师组合下,该方法较端点组合在 Math 上高 4.11 分、五个基准上高 1.95 分;两个教师时精度与端点方法持平。分阶段路由下两种阶段顺序的平均性能都更高,顺序差距从 10.50 分降至 6.42 分;交错路由(每次更新只涉及一位教师)下两种目标表现相当。以上为作者报告的结果。

AI 根据报道生成 · 56 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    Δ-MOPD:通过教师相对偏移实现多教师在线策略蒸馏

    研究者提出 Δ-MOPD,将每位教师的"教师减基座"logit 偏移重新锚定在学生冻结初始化上进行迁移,而非直接迁移教师端点策略。三个教师组合时,Δ-MOPD 较端点组合在 Math 上高出 4.11 分、五个基准上高出 1.95 分;两个教师时精度持平。分阶段路由下平均性能更高,顺序差距从 10.50 分降至 6.42 分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。