跳到正文
热点事件持续更新

BoT-GRPO:token级过程奖励的高效强化学习法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Yingxiang Yang 等人发布论文提出 BoT-GRPO 方法,将 GRPO 扩展到 token 级奖励模型。其做法是收集各次 rollout 中的所有 token 级奖励,按来源序列长度的倒数加权,再相对加权后的组统计量计算每个 token 的优势,使聚合结果与序列长度无关。该方法无需 critic,可直接替换 GRPO。 论文称这一设计实现了“长度无关”的 bag of tokens 聚合,面向的是推理任务中的过程奖励强化学习。这些效果表述来自论文自身,尚未见独立验证。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    BoT-GRPO:通过 Bag-of-Token 聚合实现高效过程奖励推理强化学习

    BoT-GRPO 将 GRPO 扩展到 token 级奖励模型,通过长度无关的 bag of tokens 聚合计算每 token 优势,无需 critic、可直接替换 GRPO。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。