MetaOPD:元学习令牌加权的在线策略蒸馏
热点事件持续更新
MetaOPD:元学习令牌加权的在线策略蒸馏
1 篇报道1 个报道来源3 小时前更新
先了解这件事
报道摘要
MetaOPD 提出一种双层优化框架,在在线策略蒸馏(OPD)中联合训练学生模型与轻量级 token 加权网络,通过虚拟更新后的验证损失优化权重网络,使预测信号到 token 权重的映射随学生模型共同演化。在六个数学推理和三个域外数据集上,0.6B 学生模型的 Avg@8/Pass@8 较 OPD 提升 1.99/5.97 个百分点,1.7B 学生模型提升 2.25/6.41 个百分点。
摘自 arXiv:cs.AI
最新进展10月9日 12:00
MetaOPD:面向在线策略蒸馏的元学习 Token 加权框架报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.AIMetaOPD:面向在线策略蒸馏的元学习 Token 加权框架
MetaOPD 提出一种双层优化框架,在在线策略蒸馏(OPD)中联合训练学生模型与轻量级 token 加权网络,通过虚拟更新后的验证损失优化权重网络,使预测信号到 token 权重的映射随学生模型共同演化。在六个数学推理和三个域外数据集上,0.6B 学生模型的 Avg@8/Pass@8 较 OPD 提升 1.99/5.97 个百分点,1.7B 学生模型提升 2.25/6.41 个百分点。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。