跳到正文
热点事件持续更新

论文称 pass@k 无法衡量后训练多样性

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Subham Rath 等人发表的论文指出,pass@k 只依赖问题被正确采样的概率,无法反映正确解之间的分布差异,因此不能用来衡量后训练后模型多样性的变化。 作者在 Qwen2.5-1.5B-Instruct 上用 GRPO 和 RFT 做数学后训练,三种多样性指标朝相反方向变化且三个随机种子间无重叠,但 pass@8 和 pass@32 在 GSM8K 上无一致赢家,只有低 k 时能区分模型。 论文称这是标准评测协议缺失其常被用来认证的属性的具体实例。该论文已被 NeurIPS 2026 Pre-training to Post-training 研讨会接收,属非存档。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    pass@k 无法衡量什么:评估后训练后的多样性与能力保留

    论文指出 pass@k 仅依赖问题被正确采样的概率,无法反映正确解的分布差异。在 Qwen2.5-1.5B-Instruct 上用 GRPO 和 RFT 做数学后训练,三种多样性指标朝相反方向变化(三个随机种子无重叠),但 pass@8 和 pass@32 在 GSM8K 上无一致赢家,仅低 k 时能区分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。