跳到正文
热点事件持续更新

CorrGRPO:相关性归一化的多奖励GRPO方法

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

2026年10月2日,HuggingFace Daily Papers 收录社区热门论文,研究者提出 CorrGRPO,用于多奖励学习场景下的 GRPO 改进。该方法将 GRPO 多奖励场景中的成对协方差归一化为 Pearson 相关系数,在保持中心化总奖励不变的同时,避免大尺度奖励主导归一化、压制小尺度奖励信号。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数模型,与 GRPO 及其他变体进行对比,三个领域均取得提升,代码已开源。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. HuggingFace Daily Papers(社区热门论文)
    CorrGRPO:面向多奖励学习的相关性归一化 GRPO

    研究者提出 CorrGRPO,将 GRPO 多奖励场景下的成对协方差归一化为 Pearson 相关系数,在保持中心化总奖励不变的同时,避免大尺度奖励主导归一化、压制小尺度奖励信号。在代码生成、工具调用和智能体安全三类任务上,用 0.5B 至 8B 参数模型与 GRPO 及其他变体对比,三个领域均取得提升。代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。