跳到正文
热点事件持续更新

arXiv 论文:CoT 验证器认证几近无效

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Arjun Balaji 在 arXiv 发布论文,用七个开源模型、五种验证器信号和 37,000 条评分思维链轨迹,考察无分布选择性保证在几十到几百个标注问题的校准预算下对 CoT 验证器的效果。论文提出“弃权有效性”这一核心发现:一份很少触发的证书可能有效,但每次使用都是错的。 在已知风险模拟中,标准证书最多在 0.3% 校准抽样中失败;但在实际触发的抽样中,失败率高达 69%。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    基于弃权的认证:小校准预算下思维链验证器的无分布保证

    研究用七个开源模型、五种验证器信号和 37,000 条评分思维链轨迹,考察无分布选择性保证在几十到几百个标注问题的校准预算下对 CoT 验证器的效果。核心发现是"弃权有效性":一份很少触发的证书可能有效,但每次使用都是错的——在已知风险模拟中标准证书最多在 0.3% 校准抽样中失败,但在触发的抽样中失败率高达 69%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。