跳到正文
热点事件持续更新

MetaOPD:元学习令牌加权的在线策略蒸馏

1 篇报道1 个报道来源3 小时前更新

先了解这件事

报道摘要

MetaOPD 提出一种双层优化框架,在在线策略蒸馏(OPD)中联合训练学生模型与轻量级 token 加权网络,通过虚拟更新后的验证损失优化权重网络,使预测信号到 token 权重的映射随学生模型共同演化。在六个数学推理和三个域外数据集上,0.6B 学生模型的 Avg@8/Pass@8 较 OPD 提升 1.99/5.97 个百分点,1.7B 学生模型提升 2.25/6.41 个百分点。

摘自 arXiv:cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    MetaOPD:面向在线策略蒸馏的元学习 Token 加权框架

    MetaOPD 提出一种双层优化框架,在在线策略蒸馏(OPD)中联合训练学生模型与轻量级 token 加权网络,通过虚拟更新后的验证损失优化权重网络,使预测信号到 token 权重的映射随学生模型共同演化。在六个数学推理和三个域外数据集上,0.6B 学生模型的 Avg@8/Pass@8 较 OPD 提升 1.99/5.97 个百分点,1.7B 学生模型提升 2.25/6.41 个百分点。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。