SR-OPD:成功轨迹引导的在线策略蒸馏
热点事件持续更新
SR-OPD:成功轨迹引导的在线策略蒸馏
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
Xiang Chen 等研究者提出 Success-Referenced On-Policy Distillation(SR-OPD),通过筛选哪些提示词和 rollout 接受教师监督来降低在线策略蒸馏成本。其做法是:当学生模型对同一提示词同时产生成功与失败 rollout 时,以成功 rollout 为参照,优先监督隐藏状态轨迹持续偏离成功参照的失败 rollout。 据该研究,这一方法将教师 token 消耗降至 3.46-5.02%。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
SR-OPD:用成功轨迹引导的在线策略蒸馏,教师 token 消耗降至 3.46-5.02%报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.AISR-OPD:用成功轨迹引导的在线策略蒸馏,教师 token 消耗降至 3.46-5.02%
研究者提出 Success-Referenced On-Policy Distillation(SR-OPD),通过筛选哪些提示词和 rollout 接受教师监督来降低在线策略蒸馏成本:当学生模型对同一提示词同时产生成功与失败 rollout 时,以成功 rollout 为参照,优先监督隐藏状态轨迹持续偏离成功参照的失败 rollout。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。