ZCPO:用条件KL校准解决组策略优化中KL失效
热点事件持续更新
ZCPO:用条件KL校准解决组策略优化中KL失效
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
arXiv 计算语言学论文针对组策略优化中参考策略 KL 正则化与奖励交互的问题,提出零和校准策略优化(ZCPO)。 研究称 KL 正则化存在七种失效模式,包括奖励裁剪后的残余 KL 更新、梯度抵消、组内奖励相同时的 KL 更新、KL 随响应长度增长及相对贡献失衡、KL 集中于少量 token,以及 k1 融入奖励时的采样噪声。 Fei Ding 提出 ZCPO,用条件 KL 衡量的相对漂移校准组内奖励系数,并整合进基础代理目标。报道未给出实验效果。
AI 根据报道生成 · 1 小时前更新
最新进展10月9日 12:00
为何 KL 正则化在组策略优化中失效:ZCPO 提出条件 KL 校准方案报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.CL为何 KL 正则化在组策略优化中失效:ZCPO 提出条件 KL 校准方案
研究分析了参考策略 KL 正则化与奖励交互中的七种失效模式,包括奖励裁剪后的残余 KL 更新、梯度抵消、组内奖励相同时的 KL 更新、KL 随响应长度增长及相对贡献失衡、KL 集中于少量 token,以及 k1 融入奖励时的采样噪声。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。