跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang, Xiaomin Li, Yuexing Hao, Yu Hu, Muhao Chen, Varun Chandrasekaran, Andrzej Banburski-Fahey, Jaron Lanier·· 1 天前AI 评分42

ProVer:面向智能体强化学习关键决策的细粒度信用分配框架

Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning

AI 导读

ProVer 通过智能体评判器对比成功与失败轨迹,定位可能决定成败的片段,再用该片段前后续写成功率之差验证其优势,并将正值计入 GRPO 优势。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在 Qwen3.5-2B 和 Qwen3.5-4B 两个规模均取得最强平均表现,相对 GRPO 分别提升 9.91% 和 7.12%。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org