热点事件持续更新
CorrGRPO:相关性归一化的多奖励GRPO方法
1 篇报道1 个报道来源11 小时前更新
先了解这件事
AI 综述
2026年10月2日,HuggingFace Daily Papers 收录社区热门论文,研究者提出 CorrGRPO,用于多奖励学习场景下的 GRPO 改进。该方法将 GRPO 多奖励场景中的成对协方差归一化为 Pearson 相关系数,在保持中心化总奖励不变的同时,避免大尺度奖励主导归一化、压制小尺度奖励信号。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数模型,与 GRPO 及其他变体进行对比,三个领域均取得提升,代码已开源。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 08:50
研究者提出 CorrGRPO,以 Pearson 相关系数归一化多奖励,三类任务均优于 GRPO。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- HuggingFace Daily Papers(社区热门论文)CorrGRPO:面向多奖励学习的相关性归一化 GRPO
研究者提出 CorrGRPO,将 GRPO 多奖励场景下的成对协方差归一化为 Pearson 相关系数,在保持中心化总奖励不变的同时,避免大尺度奖励主导归一化、压制小尺度奖励信号。在代码生成、工具调用和智能体安全三类任务上,用 0.5B 至 8B 参数模型与 GRPO 及其他变体对比,三个领域均取得提升。代码已开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。