BoT-GRPO:token级过程奖励的高效强化学习法
热点事件持续更新
BoT-GRPO:token级过程奖励的高效强化学习法
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Yingxiang Yang 等人发布论文提出 BoT-GRPO 方法,将 GRPO 扩展到 token 级奖励模型。其做法是收集各次 rollout 中的所有 token 级奖励,按来源序列长度的倒数加权,再相对加权后的组统计量计算每个 token 的优势,使聚合结果与序列长度无关。该方法无需 critic,可直接替换 GRPO。 论文称这一设计实现了“长度无关”的 bag of tokens 聚合,面向的是推理任务中的过程奖励强化学习。这些效果表述来自论文自身,尚未见独立验证。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
BoT-GRPO:通过 Bag-of-Token 聚合实现高效过程奖励推理强化学习报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.LGBoT-GRPO:通过 Bag-of-Token 聚合实现高效过程奖励推理强化学习
BoT-GRPO 将 GRPO 扩展到 token 级奖励模型,通过长度无关的 bag of tokens 聚合计算每 token 优势,无需 critic、可直接替换 GRPO。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。