ProVer框架优化Agentic RL信用分配
先了解这件事
2026年9月30日,arXiv cs.CL 分类发布 ProVer,一个面向智能体强化学习关键决策的细粒度信用分配框架。据该报道,ProVer 通过智能体评判器对比成功与失败轨迹,定位可能决定成败的片段,再用该片段前后续写成功率之差验证其优势,并将正值计入 GRPO 优势。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在 Qwen3.5-2B 和 Qwen3.5-4B 两个规模均取得最强平均表现,相对 GRPO 分别提升 9.91% 和 7.12%。2026年10月2日,DAIR.AI 的 Elvis Saravia 在 X 上介绍该工作,称其用 LLM 裁判定位轨迹中决定成败的关键片段,再由 rollout 决定该片段应得多少信用,以解决 GRPO 给轨迹中每个 token 相同优势、无法区分关键步骤的问题;并提到裁判换成更小模型时仍有效。目前该工作处于论文发布与传播阶段,尚无后续进展报道。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- X:Elvis Saravia (@omarsar0, DAIR.AI)ProVer:智能体 RL 的信用分配新方法
ProVer 提出用 LLM 裁判定位轨迹中决定成败的关键片段,再由 rollout 决定该片段应得多少信用,解决 GRPO 给轨迹中每个 token 相同优势、无法区分关键步骤的问题。在 ALFWorld、WebShop 和 SearchQA 上,该方法相对 GRPO 对 Qwen3.5-2B 提升 9.91%、对 Qwen3.5-4B 提升 7.12%,且裁判换成更小模型时仍有效。
- arXiv:cs.CL(计算语言学,全量分类)ProVer:面向智能体强化学习关键决策的细粒度信用分配框架
ProVer 通过智能体评判器对比成功与失败轨迹,定位可能决定成败的片段,再用该片段前后续写成功率之差验证其优势,并将正值计入 GRPO 优势。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在 Qwen3.5-2B 和 Qwen3.5-4B 两个规模均取得最强平均表现,相对 GRPO 分别提升 9.91% 和 7.12%。
本事件热度走势
当前热度 9·可比范围峰值 10(10月2日 17:00)·近 24 小时可比范围变化 +124%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。