跳到正文
原文
arXiv:cs.LG(机器学习,全量分类)· Hsiao-Ru Pan, Florent Draye, Bernhard Sch\"olkopf·· 1 天前AI 评分35

ABC:面向可验证奖励强化学习的优势型控制变量

ABC: Advantage-Based Control Variates for Reinforcement Learning with Verifiable Rewards

AI 导读

研究提出 Advantage-Based Control Variates(ABC),通过优势-价值形式重新审视轨迹级控制变量,并揭示其协方差结构与 Direct Advantage Estimation(DAE)的回报分解密切相关。

来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org