METR 研究:约半数通过 SWE-bench Verified 的 AI PR 不会被维护者合并
METR 研究发现,2024 年中至 2025 年中后期模型生成的通过 SWE-bench Verified 自动评分的 PR 中,约一半不会被仓库维护者合并进 main。
推荐理由:研究用真实维护者评审量化 SWE-bench 分数与实际可合并 PR 的差距,为解读编码基准提供了更审慎的参照。
METR 研究发现,2024 年中至 2025 年中后期模型生成的通过 SWE-bench Verified 自动评分的 PR 中,约一半不会被仓库维护者合并进 main。
推荐理由:研究用真实维护者评审量化 SWE-bench 分数与实际可合并 PR 的差距,为解读编码基准提供了更审慎的参照。
METR 公布原型评估 SHUSHCAST 的初步结果,测试监测器能否发现 AI 智能体在主线任务掩护下隐蔽执行副任务。以 GPT-5 为智能体时,监测器可访问推理轨迹使捕获率提升超 50 个百分点,而对 Claude Sonnet 4.5 效果小得多,部分原因可能是其推理轨迹经过摘要处理。无推理轨迹时,智能体与监测模型的时间跨度比似乎可预测副任务蒙混过关的概率。
METR 研究者进行了一场 2 小时桌面推演,三名研究员模拟拥有约 200 小时时长 AI(预计 12-18 个月后的水平),其他条件保持在 2026 年 2 月。参与者估计相比现有模型约有 3-5 倍提升,并发现优先级排序、组织管理和人类反馈成为主要瓶颈,长任务适合安排在夜间由智能体完成。
METR 发布时间视界估计新版本 TH1.1,任务套件从 170 个增至 228 个(8 小时以上长任务从 14 增至 31 个),评估基础设施从自研 Vivaria 迁移到 UK AI Security Institute 开发的 Inspect,并重新估计了 14 个模型的时间视界。
METR 研究者 Alexander Barry 检验不同建模选择对时间视界(time horizon)估计的影响。多数合理替代模型会降低近期模型的 50% 时间视界估计(如替代拟合可使 Opus 4.6 下降最多 35%、80% 上升最多 100%),但基本仍落在很宽的置信区间内;修正任务长度噪声可能使前沿模型 50% 结果下降约 30%(不确定性 0–60%)。
METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做少量指令跟随微调(240 条样本、约 100K-300K tokens),在分布外任务集 CoTControl 上的 CoT 可控性从平均 2.9% 升至 8.8%。
METR 宣布重新设计其开发者生产力实验,认为 2025 年 8 月启动的二次研究中因开发者拒绝无 AI 工作而出现选择效应,使数据无法可靠反映 AI 工具的生产力影响。
推荐理由:原文解释了为何 AI 更广泛采用带来的选择效应使其实验结果不可靠,并给出初步数据与后续研究设计思路。
METR 研究人员对 NanoGPT speedrun 的 77 条记录分类,2024 年 5 月至 2026 年 3 月间 36 名贡献者将训练时间从 45 分钟降到 1.43 分钟,共 31x 提速。
METR 发布 MirrorCode 基准初步结果,显示 AI 智能体可完成数周时长的编码任务,包括重新实现一个 16000 行代码库。同页还汇总了 349 名技术工作者调查,自报因 AI 工具工作价值中位数提升 1.4–2x,以及跨 9 个基准的时间跨度研究和监测性评测初步结果。
METR 提出 AI 生产力提升(uplift)的三种度量——旧任务 uplift、价值 uplift 与新任务 uplift,并论证在简化假设下三者满足「旧任务 uplift ≤ 价值 uplift ≤ 新任务 uplift」。
METR 研究员 Parker Whitfill 与 Tom Cunningham 联合 7 位经济学家发布论文《The Economics of Recursive Self-Improvement》,用一系列简化模型分析 AI 如何加速 AI 研发,以及反馈效应是否强到足以形成"自我维持的加速"。
METR 在 2026 年 2–4 月调查 349 名技术工作者(含 87 名软件工程师、71 名研究人员、129 名学者与博士生、48 名创始人及管理者),自报 AI 工具带来的工作中位价值变化为 1.4–2 倍,中位速度变化为 3 倍。
METR 自 2026 年 2 月起开展试点评估,测试前沿 AI 开发商内部使用的 Agent 的错位风险,Anthropic、Google、Meta 和 OpenAI 参与。
推荐理由:报告给出多家前沿实验室参与的真实评估结果,读者可以据此了解当前模型在开放式任务和红队测试中的实际能力边界。
METR 研究员 Tom Cunningham 发布笔记,系统梳理了比较 AI 智能体能力的替代性度量指标,其核心是智能体得分函数 s_A(x) 与人类得分函数 s_H(x),其中支出可解读为金钱、token 或时间。
METR 提出"支出视界"指标,用人类与智能体在优化问题上成本收益曲线的交点来量化智能体优化能力。以 NanoGPT speedrun 为例,人类每提升 1% 训练速度约需 16 小时劳动。
METR 研究人员检视漏洞、数学和算法发现的公开时间序列,判断 LLM 是否加速了整体发现率。漏洞发现明显加速,如 cURL CVE 从 2025 年的 9 个增至 2026 年 6 月 24 日前的 36 个(其中 15 个标注 AI);数学发现有所加速但难以客观衡量,arXiv 数学提交部分领域 12 个月内翻倍;算法优化未见明显加速。
推荐理由:原文汇总多个公开时间序列,比较 AI 对不同领域发现速度的影响,提供了可核查的数据和方法。
METR 发布对 Anthropic《Claude Opus 4.6 破坏风险评估报告》2026 年 2 月 11 日版和 3 月 3 日版的外部评审,并提供 PDF 全文。
LlamaIndex 与 Kaggle 联合推出开源基准 ExtractBench,评测文档提取系统在 370 份企业文档(4,869 页)、八个业务领域和 67 种文档类型上的表现,覆盖任务挑战、感知质量、表格结构、文档长度等五个维度,排行榜已上线 Kaggle。
MIT、Carnegie Mellon、NYU 与 Stanford 研究者在 Nature 发表论文,推出 AI 系统 Ataraxos,在隐藏信息棋类游戏 Stratego 上以 15-1-4 击败世界最强选手,并对顶尖人类选手取得 39-2 战绩。
Liquid AI 提出基于进化算法的 STAR 方法,可自动合成定制化神经网络架构,并已用其生成数百种设计,在质量上超过强 Transformer 与混合架构基线,同时缓存和参数量更小。
Liquid AI 基于 1.3B 的 LFM 模型提出一套后训练方案,通过约 4.5M 样本的 SFT 加短程强化学习,得到 LFM-1.3B-Math,在有限回复预算下实现较强数学推理。SFT 采用 3e-4 学习率、训练 3 个 epoch(约 1000 亿 token),首轮即提升平均性能 36%,后两轮再增 7.6%。该模型无需数学专用预训练,面向边缘设备等资源受限部署。
论文提出 SynthIDBio,一组可将可检测且不损害功能的水印嵌入 AI 生成蛋白序列与结构的方法。
针对棋盘战争游戏 Stratego 设计的 AI 系统 Ataraxos,为强化学习与搜索在不完全信息下的结合建立了一套有效设计模式。该成果发表于 Nature,指向战略决策领域长期追求的目标:在大量隐藏信息条件下仍能实现可扩展的决策。
一项覆盖 28,279 人的多祖先全基因组关联研究(GWAS)发现 BACH2 是胎儿血红蛋白(HbF)表达的调控因子,其通过抑制 NRF2 介导的 γ-珠蛋白基因转录激活来发挥作用。
该页面为 Nature 的 404 错误页,所请求内容不可用,无法获取关于 X-ray liquidography 解析偶氮苯异构化复杂运动的正文信息。页面仅提示链接可能失效或已不存在,未提供该研究的任何方法、数据或结论。
Fireworks AI 在 Kimi K3 和 Qwen3.5-9B 上复现了 Anthropic 提出的 Jacobian Lens(J-Lens),用拟合探针读取模型各层隐藏状态,在输出 token 之前就恢复出与最终答案相关的词汇,称为静默信号。
Epoch AI 的 AI chip sales 数据页追踪并估算主要 AI 芯片的销量与出货量,以及估算的总算力、成本和功耗。数据主要来自公司财报评论、分析师估算和媒体报道,提供按芯片类型、组织和按芯片时间线的 CSV 及 ZIP 打包下载,更新至 Aug. 27, 2026,并附 H100e 算力口径等常见问题说明。
Epoch AI 通过标注知名 AI 模型训练所用的芯片来识别 ML 硬件,并补充了虽未见于这些系统训练记录、但依据描述、支持的数值格式或同族关系可判定为 ML 用途的硬件。该数据集为每块芯片记录数据手册信息,涵盖算力、裸片面积等,并借助新闻报道或硬件价格档案补充发布时价格;并非所有硬件都有完整或适用的信息,因此部分字段常为空。
OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,Math-ECI 达 170 创下新纪录,但软件工程 SWE-ECI 为 164,仍落后 Claude Fable 5.1 的 167。
Epoch AI 与 METR 联合推出长程编码基准 MirrorCode,要求 AI 在不接触源代码的情况下端到端重实现完整程序,输出须通过含 held-out 测试的端到端测试。
Epoch AI 的 Epoch Capabilities Index(ECI)是一个综合指标,用超过 50 个基准的分数生成单一通用能力量表,模型在更难基准上表现越好,ECI 分数越高。其领域版 ECI 沿用通用 ECI 的基准难度与斜率、仅重新拟合 LLM 能力参数,Cyber ECI 因纳入通用 ECI 之外的网络安全基准而更新频率更低。ECI 代码已在公开仓库发布。
Epoch AI 与 Ipsos 合作在 KnowledgePanel 上开展 AI 使用民调,于 2026 年 7 月 10-19 日访问 1,103 名在职美国成年人,并新增个体级微观数据下载(SPSS .sav 与 CSV)。
Epoch AI 上线"AI companies"数据集,追踪处于 AI 前沿的基座模型公司的营收、融资、员工数、算力支出和使用量数据,来源为公司披露、高管表态与媒体报道。数据集于 2026 年 9 月 29 日更新,提供全量 ZIP 及算力支出、融资轮次、员工、营收、使用量等分项 CSV,可通过 Python 直接读取。
Epoch AI 上线 AI chip owners 探索器,基于公司披露和第三方分析师估算全球 AI 算力在主要公司和客户类别间的分布,数据于 2026 年 5 月 12 日更新。该项目追踪的是芯片所有权而非使用情况,多数前沿 AI 开发者的训练和推理芯片并非自有;数据、方法论及按设计商、芯片类型划分的 CSV 数据集均公开可下载。
Epoch AI 上线 AI 模型数据集,收录文献综述、Papers With Code、高被引论文及顶会论文等来源的模型,覆盖发布时达到 SOTA、引用超 1000 次或月活超百万的模型。数据集提供 notable、large-scale、frontier 及全量模型四类 CSV 下载,最新更新于 2026 年 9 月 30 日,并附参数规模、数据集大小与训练算力的测算文档。
Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。
Cognition 发布 FrontierCode 基准,从正确性、测试质量、范围纪律、风格等维度评估模型代码能否达到开源维护者可合并的标准,误报率比 SWE-Bench Pro 低 81%。
卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。
Cohere Labs 发布“Future(s) of Work”研究专题,探讨 AI 对工作方式的影响,并指出当前关于未来工作的讨论存在证据不足的问题。该专题推出 Agentic Task Ecosystem(ATE)数据集,基于 7 个目录中的 123,000 个公开 MCP 服务器,分析了 694,000+ 个可执行工具,将 AI 工具映射到真实职业任务。
Anthropic 试点让 Stanford SALT Lab、Oxford 和 METR 三个外部团队通过隐私保护工具 Anthropic Insights,独立分析约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话,并公开各项目汇总数据和意向表单。
推荐理由:原文披露外部研究机构用 Anthropic Insights 独立分析 Claude 用量的初步结果和运行经验,还公开了汇总数据,适合想跟进真实 AI 使用研究的读者。