研究揭示后验集中现象并提出RLCPR框架
热点事件持续更新
研究揭示后验集中现象并提出RLCPR框架
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Shiu-Hong Kao 等作者在 arXiv 发表研究,指出基于概率奖励的无验证器强化学习存在长度依赖的失效模式——后验集中现象(PCP):推理链越长,参考答案的条件概率越坍缩到低方差区间,奖励几乎无法区分,导致 GRPO 类策略优化不稳定。 为此作者提出无验证器强化学习框架 RLCPR,包含不确定性感知数据采样与集中感知正则化两个组件。作者称,该框架在七个基准中的六个上比 SOTA 无验证器 RL 基线最高提升 4.0%,同时提升 token 效率。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
从后验集中现象重新思考基于概率的强化学习报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.AI从后验集中现象重新思考基于概率的强化学习
研究揭示基于概率奖励的无验证器强化学习存在长度依赖的失效模式——后验集中现象(PCP):推理链越长,参考答案的条件概率越坍缩到低方差区间,导致奖励几乎无法区分,使 GRPO 类策略优化不稳定。为此提出 RLCPR 框架,包含不确定性感知数据采样与集中感知正则化两个组件,在七个基准中的六个上比 SOTA 无验证器 RL 基线最高提升 4.0%,同时提升 token 效率。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。