arXiv:cs.LG(机器学习,全量分类)· Hsiao-Ru Pan, Florent Draye, Bernhard Sch\"olkopf·· 1 天前AI 评分35
ABC:面向可验证奖励强化学习的优势型控制变量
ABC: Advantage-Based Control Variates for Reinforcement Learning with Verifiable Rewards
AI 导读
研究提出 Advantage-Based Control Variates(ABC),通过优势-价值形式重新审视轨迹级控制变量,并揭示其协方差结构与 Direct Advantage Estimation(DAE)的回报分解密切相关。
来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org