跳到正文
热点事件持续更新

Range-GRPO:用奖励区间优化策略

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年10月3日,arXiv cs.LG 分类发布研究,提出 Range-GRPO,一种半监督后训练框架。该框架将 LLM-as-a-Judge 的伪奖励表示为经保形校准的奖励区间,并在 GRPO 中直接对奖励区间做成对比较,而非压缩为单点奖励,使区间不确定性同时影响学习信号的方向与幅度。目前报道仅涉及方法提出,尚无后续实验或应用进展。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. arXiv:cs.LG(机器学习,全量分类)
    Range-GRPO:通过奖励区间成对关系进行策略优化

    研究者提出 Range-GRPO,一种半监督后训练框架,将 LLM-as-a-Judge 的伪奖励表示为经保形校准的奖励区间,并在 GRPO 中直接对奖励区间做成对比较,而非压缩为单点奖励,使区间不确定性同时影响学习信号的方向与幅度。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。