跳到正文
热点事件持续更新

ZCPO:用条件KL校准解决组策略优化中KL失效

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

arXiv 计算语言学论文针对组策略优化中参考策略 KL 正则化与奖励交互的问题,提出零和校准策略优化(ZCPO)。 研究称 KL 正则化存在七种失效模式,包括奖励裁剪后的残余 KL 更新、梯度抵消、组内奖励相同时的 KL 更新、KL 随响应长度增长及相对贡献失衡、KL 集中于少量 token,以及 k1 融入奖励时的采样噪声。 Fei Ding 提出 ZCPO,用条件 KL 衡量的相对漂移校准组内奖励系数,并整合进基础代理目标。报道未给出实验效果。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    为何 KL 正则化在组策略优化中失效:ZCPO 提出条件 KL 校准方案

    研究分析了参考策略 KL 正则化与奖励交互中的七种失效模式,包括奖励裁剪后的残余 KL 更新、梯度抵消、组内奖励相同时的 KL 更新、KL 随响应长度增长及相对贡献失衡、KL 集中于少量 token,以及 k1 融入奖励时的采样噪声。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。