热点事件持续更新
METR研究:算法评分高估AI编码能力
1 篇报道1 个报道来源13 小时前更新
先了解这件事
AI 综述
2026年9月30日,METR发布研究,指出单元测试等算法评分会高估AI智能体的真实编码表现。研究在来自stdlib-js和hypothesis两个仓库的18个真实任务上,用Inspect ReAct智能体运行Claude 3.7 Sonnet,算法评分显示成功率为38%(±19%,95% CI)。但人工抽查其中15个PR,无一可直接合并。研究由此认为,算法评分与人工判断之间存在明显落差,前者高估了AI智能体的实际编码能力。
AI 根据报道生成 · 10 小时前更新
最新进展9月30日 23:28
METR研究显示算法评分成功率38%,但人工抽查15个PR无一可直接合并。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- METR:ResearchMETR 研究:单元测试评分高估 AI 智能体真实编码表现
METR 在来自 stdlib-js 和 hypothesis 两个仓库的 18 个真实任务上,用 Inspect ReAct 智能体运行 Claude 3.7 Sonnet,算法评分下成功率为 38%(±19%,95% CI),但人工抽查的 15 个 PR 中无一可直接合并。
本事件热度走势
当前热度 7·可比范围峰值 9(10月1日 02:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。