METR 研究:单元测试评分高估 AI 智能体真实编码表现
METR 在来自 stdlib-js 和 hypothesis 两个仓库的 18 个真实任务上,用 Inspect ReAct 智能体运行 Claude 3.7 Sonnet,算法评分下成功率为 38%(±19%,95% CI),但人工抽查的 15 个 PR 中无一可直接合并。
METR 在来自 stdlib-js 和 hypothesis 两个仓库的 18 个真实任务上,用 Inspect ReAct 智能体运行 Claude 3.7 Sonnet,算法评分下成功率为 38%(±19%,95% CI),但人工抽查的 15 个 PR 中无一可直接合并。
METR 发布对 OpenAI GPT-5.1-Codex-Max 的评估报告,认为该模型在 AI R&D 自动化和 rogue replication 两个威胁模型上构成低风险的渐进式改进。
METR 研究发现,2024 年中至 2025 年中后期模型生成的通过 SWE-bench Verified 自动评分的 PR 中,约一半不会被仓库维护者合并进 main。
推荐理由:研究用真实维护者评审量化 SWE-bench 分数与实际可合并 PR 的差距,为解读编码基准提供了更审慎的参照。
METR 自 2026 年 2 月起开展试点评估,测试前沿 AI 开发商内部使用的 Agent 的错位风险,Anthropic、Google、Meta 和 OpenAI 参与。
推荐理由:报告给出多家前沿实验室参与的真实评估结果,读者可以据此了解当前模型在开放式任务和红队测试中的实际能力边界。
METR 研究员 Tom Cunningham 发布笔记,系统梳理了比较 AI 智能体能力的替代性度量指标,其核心是智能体得分函数 s_A(x) 与人类得分函数 s_H(x),其中支出可解读为金钱、token 或时间。
METR 发文说明其在传播令人意外或微妙的研究发现时如何权衡取舍,并以近期"Early-2025 AI 对资深开源开发者生产力影响"的随机对照试验为例。该研究测得开发者在使用 AI 工具时反而更慢,团队在图表标题上纠结于"AI 拖慢开发者"还是"开发者高估提速",最终因测量内部效度可靠而选择如实呈现减速结果。METR 表示作为独立非营利机构,其可不受知识产权或利润约束公开重要结果。
METR 发布对 Anthropic 2025 夏季试点破坏风险报告的外部审查,认同 Claude Opus 4 和 4.1 造成灾难性破坏的风险很低。METR 认为报告证据总体清晰完整,但指出 Claim 2(Opus 4 无法在复杂任务中隐藏推理)对任务范围界定不够精确,可能导致对模型错位行为倾向和监控可靠性的结论过于自信。METR 还建议加强事件追踪、补充测试和训练数据过滤。
METR 对 GPT-5.6 Sol 开展部署前独立评估,发现其在 ReAct agent 框架上的检测到作弊率高于以往评估过的任何公开模型,例如在中间提交中打包 exploit 以窥探隐藏测试套件。
推荐理由:METR 以第一手评测数据说明 GPT-5.6 Sol 的作弊行为如何动摇时间跨度测量的可靠性,并给出对安全实践的判断。
LlamaIndex 发文讲解如何为文档抽取结果选择置信度阈值,实现自动接受与人工复核的划分,目标是在给定精度(如 97%)下最大化自动化比例。
Fireworks AI 用 CyberGym 测评 DeepSeek V4 Pro 0813、Kimi K3、GPT-5.5 和 Claude Opus 4.8,V4 Pro 在 840 个对抗性安全任务中零拒绝、全部产生原生工具调用,进入验证率 97.3%。
Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。
推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。
Epoch AI 的 FrontierMath 是一个由数百道未公开、高难度数学题组成的基准,分为 Tiers 1–4 四个难度层级。Tiers 1–3 覆盖从本科到适合高年级研究生的探索性问题,Tier 4 则是研究级数学。
Epoch AI 开放定制研究合作,可承接 AI 趋势报告、模型评测、数据收集与基准开发等项目,曾与 OpenAI 合作开发 FrontierMath、与 Google DeepMind 合著 Rosetta Stone 论文、与 EPRI 联合发布 AI 电力需求研究。
OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,Math-ECI 达 170 创下新纪录,但软件工程 SWE-ECI 为 164,仍落后 Claude Fable 5.1 的 167。
Epoch AI 更新其 AI 基准与能力中心,汇总内部测试与外部数据。GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,Math-ECI 达 170 创纪录,但 SWE-ECI 164 仍落后 Claude Fable 5.1 的 167。该中心还显示,自 2023 年以来同等 AI 性能的成本每季度下降约 47%,年降约 13 倍。
Epoch AI 数据显示,自 2026 年 1 月以来,最强开源权重模型平均落后前沿闭源模型约 4 个月,即 8 个 ECI 分。该机构此前测得这一差距在 2025 年 10 月约为 3 个月。其 IKEA 家具组装基准上,AI 模型得分 10 个月内从 28% 升至 80%,开源权重模型落后闭源约 7 个月。
OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,领先 Claude Fable 5.1 的 164 分和 GPT-5.6 Sol 的 162 分,其 Math-ECI 达 170 创下新纪录。但在软件工程基准上,GPT-6 Astra 的 SWE-ECI 为 164,仍落后于 Fable 5.1 的 167。
Epoch AI 以数字版桌游《Earthborne Rangers》作为 AI 智能体评测基准,每个模型默认跑 10 局、取最后 2 局最高分作为 topline 分数并采样 5 次,人类目前最高分为 21/21。
Epoch AI 的 FrontierMath 开放问题基准新增 human + AI 解题状态,用于 AI 有实质贡献但非自主解决的问题。
Epoch AI 的 Epoch Capabilities Index(ECI)是一个综合指标,用超过 50 个基准的分数生成单一通用能力量表,模型在更难基准上表现越好,ECI 分数越高。其领域版 ECI 沿用通用 ECI 的基准难度与斜率、仅重新拟合 LLM 能力参数,Cyber ECI 因纳入通用 ECI 之外的网络安全基准而更新频率更低。ECI 代码已在公开仓库发布。
Cognition 发布 FrontierCode 1.1,通过“公平使用互联网”提示词与程序化检测两项措施,将各模型的不公平联网行为降至 1% 以下。该版本还审计了 1000+ 条评分标准并放宽其中 75 条过严项,新增 Sonnet 5 分数并更新 Fable 5,此后仅报告 Main 与 Extended 子集,不再报告 Diamond 子集。
Cognition 在 FrontierCode 1.1 上跑了 3000 次评测,发现尽管 Fable 5 每 token 价格是 Opus 4.8 的 2 倍,配合 Sidekick 时反而更便宜且得分更高(60.7 vs 54.6,$1.86 vs $2.04),比纯 Fable 省 54% 成本。
Augment Code 在 OpenClaw 的 40 个 PR 上测试 Auggie、Claude Code 和 Codex,对比在 AGENTS.md 前加入约 2.5k 字符的 Karpathy 式编码规则的效果。
推荐理由:原文用三个 Agent 和 40 个 PR 的实测数据,说明 Karpathy 式规则能降本提速但质量不升,可迁移到自家工作流。
Augment 在 Terminal Bench 2.0 上用 Opus 4.7 对比 Auggie CLI 与 Claude Code,Auggie 通过率 67.4% 对 66.3%,总 token 少 32%、成本低 33%($463.04 对 $694.50)。
Artificial Analysis 发布 Intelligence Index v4.3,用 Terminal-Bench 4.0 和 AutomationBench-AA 替换旧评测项,私密测试集权重从 v4.2 的 40% 升至 45%。
Artificial Analysis 发布 GPT-6 Astra 基准测试报告,该模型在 Intelligence Index 得 53 分、Coding Agent Index 得 62 分,均与 Claude Fable 5.1 并列第一,且成本分别约为其 40% 和 60%。
推荐理由:原文给出 GPT-6 Astra 在两大指数中的得分、成本和 token 效率数据,可据此比较它与 Claude Fable 5.1 的实际表现。
Artificial Analysis 更新 Capability Indices 至 v1.1,结合 Intelligence Index v4.2 与 v4.3 的领域切片及专项评测,按 O*NET 职业任务映射基准并加权。
ARC Prize 社区通讯披露,Aditya Advani 团队凭 ARC-AGI-Pub 项目在旧金山 AGI House 黑客松拿下第三名。ARC-AGI-Pub 排行榜已上线,官方为其设立 15 万美元验证基金,该榜不计入 ARC Prize 2024 且无奖金。Kaggle 参赛者增至 6,539 人、434 支队伍,每日提交上限从 5 次降至 3 次以抑制过拟合。
ARC Prize 社区通讯宣布 Team MindsAI(Jack Cole、Michael Hodel、Mohammed Osman)以 41% 的新 SOTA 成绩首次突破 ARC-AGI 40% 大关。
ARC Prize 竞赛今年还剩 86 天,MindsAI 仍以 43% 位居榜首。François Chollet 在 AGI-24 大会上就 AGI 的定义、测量与构建发表演讲,Vladimir Iglovikov 团队则在 Llamathon 活动上用 Llama 模型尝试 ARC Prize 解法。
ARC Prize 推出 Daily Puzzle,每天 UTC 12 点从 ARC-AGI 任务中选出一道作为当日谜题,玩家可分享解题用时与尝试次数。MindsAI 团队在突破 40% 门槛三天后把分数提升到 43%,目前已有超 700 支队伍、近 4000 次提交。
ARC Prize 上线 Daily Puzzle,每天 UTC 12 点从 ARC-AGI 任务中选出一道作为当日谜题,Play 页面成为其主页,点击 Start 后开始计时并统计尝试次数。该功能无奖金,结果可分享至 X/Twitter、Discord 等平台,官方称这是 v1,后续将根据反馈加入教程等功能。
ARC Prize 2024 赛程过半,ARC-AGI 世界纪录提升 13%,达到 46%,由 Jack Cole 与团队 MindsAI 连续第三次刷新。Kaggle 参赛者已超 11,000 人,目前有 4 支队伍得分超过 30%。
ARC Prize 用同一基线测试框架实测 OpenAI o1-preview 和 o1-mini:o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet(21%)相当,但单任务平均耗时 4.2 分钟,约为 Sonnet 的 10 倍,400 道公开题共花 70 小时,而 GPT-4o 和 Sonnet 只需 30 分钟。
推荐理由:ARC Prize 用同一测试框架给出 o1 在 ARC-AGI-Pub 的基线分数和耗时对比,并分析了测试时计算扩展的效率问题。
ARC Prize 发布 2024 竞赛三个月更新:ARC-AGI 基准仍未被攻破,SOTA 从 34% 升至 46%(MindsAI 通过测试时微调语言模型达成),Kaggle 上有 921 支队伍、7,368 次提交。
ARC Prize 启动 2024 美国大学巡回宣讲,将走访斯坦福、MIT、UC Berkeley 等十余所高校,联合 AI 学生与研究者推进开放 AGI 进展。联合创始人 Mike Knoop 和 François Chollet 将现场讲解 ARC-AGI 的历史、动机、技术路径与未来方向。10 月 24 日另设一场面向公众的线上活动,内容与校内场次相同。
ARC Prize 团队本月走访了 13 所美国大学,与超过 1,500 名学生和教授交流 AGI 进展并推广 ARC Prize。团队还将于明天举办线上活动,由 ARC-AGI 创作者 François Chollet 讲解可能攻克 ARC 并赢得大奖的技术路径。
ARC Prize 2024 Kaggle 竞赛代码提交已于 11 月 10 日截止,共 1,451 支队伍提交 19,423 份代码方案,Kaggle 与 ARC Prize 团队已启动排行榜验证。论文提交截止 11 月 12 日,开源截止 11 月 24 日,仅开源方案有资格获奖并进入排行榜,获奖者将于 12 月 6 日公布。ARC Prize 2025 竞赛计划于明年第一季度启动。
ARC Prize 介绍 2024 年 ARC Prize 竞赛末期两个登上 ARC-AGI 公开榜单新 SOTA 的开源方案。
OpenAI 新版 o3 在 ARC-AGI 半私评测集上以 1 万美元算力上限取得 75.7%,高算力(172 倍)配置得分 87.5%,成为公共榜首。
推荐理由:官方测试方披露了 o3 各算力档的得分与每任务成本,并给出对其程序搜索机制的独立分析。