跳到正文
热点事件持续更新

SR-OPD:成功轨迹引导的在线策略蒸馏

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

Xiang Chen 等研究者提出 Success-Referenced On-Policy Distillation(SR-OPD),通过筛选哪些提示词和 rollout 接受教师监督来降低在线策略蒸馏成本。其做法是:当学生模型对同一提示词同时产生成功与失败 rollout 时,以成功 rollout 为参照,优先监督隐藏状态轨迹持续偏离成功参照的失败 rollout。 据该研究,这一方法将教师 token 消耗降至 3.46-5.02%。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    SR-OPD:用成功轨迹引导的在线策略蒸馏,教师 token 消耗降至 3.46-5.02%

    研究者提出 Success-Referenced On-Policy Distillation(SR-OPD),通过筛选哪些提示词和 rollout 接受教师监督来降低在线策略蒸馏成本:当学生模型对同一提示词同时产生成功与失败 rollout 时,以成功 rollout 为参照,优先监督隐藏状态轨迹持续偏离成功参照的失败 rollout。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。