跳到正文
热点事件持续更新

METR研究:算法评分高估AI编码能力

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年9月30日,METR发布研究,指出单元测试等算法评分会高估AI智能体的真实编码表现。研究在来自stdlib-js和hypothesis两个仓库的18个真实任务上,用Inspect ReAct智能体运行Claude 3.7 Sonnet,算法评分显示成功率为38%(±19%,95% CI)。但人工抽查其中15个PR,无一可直接合并。研究由此认为,算法评分与人工判断之间存在明显落差,前者高估了AI智能体的实际编码能力。

AI 根据报道生成 · 10 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. METR:Research
    METR 研究:单元测试评分高估 AI 智能体真实编码表现

    METR 在来自 stdlib-js 和 hypothesis 两个仓库的 18 个真实任务上,用 Inspect ReAct 智能体运行 Claude 3.7 Sonnet,算法评分下成功率为 38%(±19%,95% CI),但人工抽查的 15 个 PR 中无一可直接合并。

本事件热度走势

当前热度 7·可比范围峰值 9(10月1日 02:00)·近 24 小时可比范围变化 –

02.557.51010月1日02:0010月1日05:0010月1日08:0010月1日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。