跳到正文
热点事件持续更新

研究者提出SF-MOPD多教师在线蒸馏方法

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Xiaofei Yin等研究者提出慢-快多教师在线策略蒸馏(SF-MOPD)方法,用于缓解多教师在线策略蒸馏(MOPD)中的能力干扰。该方法将学生模型与其实时更新的指数移动平均“慢模型”耦合,在log-probability空间剔除使快模型偏离慢模型的分量。 研究称,实验显示SF-MOPD在多个模型规模上提升专业多模态能力,并降低通用能力基准上的平均退化,持续优于vanilla MOPD。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    SF-MOPD:慢-快多教师在线策略蒸馏实现能力保持

    研究者提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型与其实时更新的指数移动平均"慢模型"耦合,在 log-probability 空间剔除使快模型偏离慢模型的分量,缓解多教师在线策略蒸馏(MOPD)中的能力干扰。实验表明,SF-MOPD 在多个模型规模上有效提升专业多模态能力,并降低通用能力基准上的平均退化,持续优于 vanilla MOPD。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。