提出AIR-OPD自适应迭代修复蒸馏框架
热点事件持续更新
提出AIR-OPD自适应迭代修复蒸馏框架
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Rui Li等作者提出AIR-OPD,一种面向在线策略蒸馏的自适应迭代修复框架:引导生成器针对学生模型当前错误合成修复引导,让学生在线策略重试,失败则针对新错误生成新引导。 在DAPO-Math-17K上训练后,Qwen3-4B和Qwen3-8B在AIME24、AIME25、HMMT25上的数学推理平均成绩较最强基线最高提升3.6分,同时在MMLU-Pro和GPQA上保持基座模型表现。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
AIR-OPD:面向在线策略蒸馏的自适应迭代修复框架报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LGAIR-OPD:面向在线策略蒸馏的自适应迭代修复框架
AIR-OPD 是一种面向在线策略蒸馏的自适应迭代修复框架,通过引导生成器针对学生模型当前错误合成修复引导,让学生进行在线策略重试,失败则针对新错误生成新引导。在 DAPO-Math-17K 上训练后,Qwen3-4B 和 Qwen3-8B 在 AIME24、AIME25、HMMT25 上的数学推理平均成绩较最强基线最高提升 3.6 分,同时在 MMLU-Pro 和 GPQA 上保持基座模型表现。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。