跳到正文
热点事件持续更新

COPC:异步LLM强化学习的耦合离策略校正

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

针对异步强化学习训练中策略与优势估计双重失配的问题,Zicheng Hu 等作者提出 actor-critic 方法 COPC,将 token 级比率掩码与 TD 残差的双侧裁剪比率加权结合。作者称,在工具集成数学推理与搜索任务上,COPC 均超越最强异步基线,并在 64 步策略陈旧度下保持增益;相比同步 PPO 仍有 1.7 倍单步加速,附加开销极小。上述效果来自作者报告,尚未见独立验证。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    COPC:面向异步 LLM 强化学习的耦合离策略校正方法

    针对异步 RL 训练中策略与优势估计双重失配的问题,研究者提出 actor-critic 方法 COPC,将 token 级比率掩码与 TD 残差的双侧裁剪比率加权结合。在工具集成数学推理与搜索任务上,COPC 均超越最强异步基线,并在 64 步策略陈旧度下保持增益。相比同步 PPO 仍有 1.7 倍单步加速,附加开销极小。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。