跳到正文
热点事件持续更新

RIPO:修正PPO-Clip几何缺陷的LLM RL方法

1 篇报道1 个报道来源2 小时前更新

先了解这件事

报道摘要

针对 PPO-Clip 因用欧氏度量衡量策略差异、与策略黎曼流形内在几何不一致而导致的探索崩溃问题,研究者提出黎曼等距策略优化(RIPO),在黎曼流形上保证等距策略更新以平衡探索与利用。RIPO 取得更优的偏差-方差权衡,在七个竞赛级基准上显著超越现有 LLM RL 算法,AIME24 上较 GRPO 最高提升 60%。

摘自 arXiv:cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    RIPO:用黎曼等距策略优化解决 LLM RL 中的探索崩溃

    针对 PPO-Clip 因用欧氏度量衡量策略差异、与策略黎曼流形内在几何不一致而导致的探索崩溃问题,研究者提出黎曼等距策略优化(RIPO),在黎曼流形上保证等距策略更新以平衡探索与利用。RIPO 取得更优的偏差-方差权衡,在七个竞赛级基准上显著超越现有 LLM RL 算法,AIME24 上较 GRPO 最高提升 60%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。