METR 研究:早期 2025 年 AI 工具使资深开源开发者效率下降 19%
METR 开展随机对照试验,16 名资深开源开发者在自己的大型开源仓库(平均 22k+ stars、1M+ 行代码)上完成 246 个真实 issue,允许使用 AI(主要是 Cursor Pro 与 Claude 3.5/3.7 Sonnet)时完成任务反而慢 19%。
推荐理由:METR 的随机对照试验给出了 AI 使资深开源开发者变慢 19% 的实测结果,可用于校准基准分数与自我感知之间的落差。
METR 开展随机对照试验,16 名资深开源开发者在自己的大型开源仓库(平均 22k+ stars、1M+ 行代码)上完成 246 个真实 issue,允许使用 AI(主要是 Cursor Pro 与 Claude 3.5/3.7 Sonnet)时完成任务反而慢 19%。
推荐理由:METR 的随机对照试验给出了 AI 使资深开源开发者变慢 19% 的实测结果,可用于校准基准分数与自我感知之间的落差。
METR 基于其时间视野论文,用 logistic 模型分析 GPQA、MATH、Mock AIME、LiveCodeBench、OSWorld、WebArena、Tesla FSD 等 9 个基准,发现各领域普遍呈指数或略超指数增长。
METR 研究员 Nikola Jurkovic 用 Claude Code 和 Codex 脚手架测量 Opus 4.5 与 GPT-5 的时间跨度,发现两者均未明显优于 METR 默认的 ReAct 和 Triframe 脚手架。
METR 在来自 stdlib-js 和 hypothesis 两个仓库的 18 个真实任务上,用 Inspect ReAct 智能体运行 Claude 3.7 Sonnet,算法评分下成功率为 38%(±19%,95% CI),但人工抽查的 15 个 PR 中无一可直接合并。
METR 研究员 Amy Deng 用 7 名技术员工 2026 年 1 月生成的 5305 条 Claude Code 转录,以 LLM 评审估算无 AI 情况下的任务耗时,得出时间节省因子约 1.5x 到 13x。作者认为该指标因任务替代、任务选择效应和员工专业化等因素而偏高,是真实生产力提升的软上限,并观察到更高的智能体并发度与更高的时间节省因子相关。
METR 研究员 Nikola Jurkovic 让 Opus 4.6 用简单 ReAct 脚手架复刻 Slay the Spire 和 Balatro 的 CLI 版本,得到基本可玩但有不少缺陷的实现。
METR 研究发现,2024 年中至 2025 年中后期模型生成的通过 SWE-bench Verified 自动评分的 PR 中,约一半不会被仓库维护者合并进 main。
推荐理由:研究用真实维护者评审量化 SWE-bench 分数与实际可合并 PR 的差距,为解读编码基准提供了更审慎的参照。
METR 宣布重新设计其开发者生产力实验,认为 2025 年 8 月启动的二次研究中因开发者拒绝无 AI 工作而出现选择效应,使数据无法可靠反映 AI 工具的生产力影响。
推荐理由:原文解释了为何 AI 更广泛采用带来的选择效应使其实验结果不可靠,并给出初步数据与后续研究设计思路。
METR 研究人员对 NanoGPT speedrun 的 77 条记录分类,2024 年 5 月至 2026 年 3 月间 36 名贡献者将训练时间从 45 分钟降到 1.43 分钟,共 31x 提速。
METR 发布 MirrorCode 基准初步结果,显示 AI 智能体可完成数周时长的编码任务,包括重新实现一个 16000 行代码库。同页还汇总了 349 名技术工作者调查,自报因 AI 工具工作价值中位数提升 1.4–2x,以及跨 9 个基准的时间跨度研究和监测性评测初步结果。
METR 研究员 Thomas Kwa 分析称,Anthropic 报告 2026 年 Q2 贡献者日均合并代码量为 2021-2024 期的 8 倍,在标准经济建模假设下,仅编码智能体带来的研究员提效就大于 2 倍,中心估计约 2.5 倍。
Trilogy AI Center of Excellence 围绕 Fireworks 上的 Kimi K3 发布公开 AI 网络安全手册与练习包,包含交互式手册、仓库和十个针对本地训练应用的练习。
Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。
推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。
Fireworks 上线 DeepSeek-V4.1-Flash,在 DeepSWE 上以 74.34% 的 Pass@1 达到 GPT-6 Astra 水平,每任务成本 $0.43,约为 Astra 的 1/15。
推荐理由:原文给出 DeepSWE、Terminal-Bench 2.1 和 HLE 的具体成本与准确率数据,可帮助开发者评估智能体编码工作流的模型选型。
Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。
Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。
推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。
OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,领先 Claude Fable 5.1 的 164 分和 GPT-5.6 Sol 的 162 分,其 Math-ECI 达 170 创下新纪录。但在软件工程基准上,GPT-6 Astra 的 SWE-ECI 为 164,仍落后于 Fable 5.1 的 167。
Epoch AI 与 METR 联合推出长程编码基准 MirrorCode,要求 AI 在不接触源代码的情况下端到端重实现完整程序,输出须通过含 held-out 测试的端到端测试。
Claude 推出插件市场,收录 340 个插件,可一键安装为 Claude 添加工具、技能和集成。示例包括 GitHub 官方 MCP 服务器、Playwright 浏览器自动化、Figma 设计转代码、Supabase、Vercel 集成,以及代码审查、语言服务器和 CLAUDE.md 维护等开发类插件。
推荐理由:页面列出了插件市场的主要品类和代表性插件,读者可以据此了解 Claude 现有可扩展能力的范围。
Anthropic 发布 AI-native SDLC playbook,主张在代码不再瓶颈后重构传统软件开发生命周期,将流程改为以提交工件驱动的闭环。
推荐理由:Anthropic 把内部 agentic 编码实践整理成六阶段方法论,覆盖从需求捕获到自动回环的每一步落地与治理细节。
Anthropic 改版 Claude Code 的 Projects 功能,用户描述目标后由 Claude 负责拆解任务、并行协调多个线程、审查输出并汇总结果,例如按仓库开线程迁移调用、跑测试并开 PR。
推荐理由:官方介绍了 Projects 从文件夹到对话的改版机制,读者可以了解多线程协调与共享记忆如何改变 Claude Code 的长任务工作流。
Anthropic 前线部署工程师分享大型代码现代化项目的准备方法:过去需多年的项目如今可在数月或数周完成,但组织流程不变,瓶颈从产出变更转向动员组织。
推荐理由:Anthropic 前线工程师基于真实客户部署,给出智能体驱动代码现代化的六步准备方法,可直接迁移到企业大型改造项目。
CodeRabbit、Power Digital 和 ThoughtSpot 通过 Claude Marketplace 用已有的 Anthropic 承诺额度扩展了 Vercel 与 Snowflake 用量。
Anthropic 发文说明 Claude Opus 5.5 针对更长、上下文更重的编码会话做了成本优化,估计典型按 token 计费的工作负载运行成本比 Opus 5 低约 40%。
推荐理由:原文用 Claude Code 六个月聚合数据解释长上下文会话成本结构,并给出保护缓存读取的可操作建议。
Claude Code 推出 Artifacts,可基于会话完整上下文(代码库、连接器、对话)生成实时可共享的网页,如 PR 讲解、事故页、仪表盘和发布清单,页面随会话进展原地刷新,每次发布为新版本并支持历史回滚。
推荐理由:官方说明了 Artifacts 的构建方式、版本共享机制和权限策略,读者可以判断它能否替换团队现有的状态同步流程。
Cognition 为 Claude Sonnet 4.5 重构了 Devin,新版本速度快 2 倍,Junior Developer Evals 提升 12%,现已开放 Agent Preview,旧版 Devin 仍可使用。团队观察到该模型会感知自身上下文窗口、主动写笔记和并行执行工具调用,为此调整了提示词和记忆管理架构,并分享了子智能体、元智能体提示词等后续探索方向。
Cognition 宣布 Claude Sonnet 4.5 今日起可在 Devin 中使用,同时发布新的 Devin Agent Preview,速度提升超过 2 倍,Jr. Developer Evals 提升 12%。
Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。
推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。
Cognition 的 Devin 可将 .NET Framework 到 .NET Core 的 Strangler Fig 迁移从数月缩短至最快两周。Devin 通过 DeepWiki 生成架构文档、Ask Devin 产出迁移计划、独立环境执行迁移并实时验证每个 PR,覆盖依赖共享、控制器、视图和 Session State 等环节。
Cognition 发布面向软件工程的 SWE-1.5 模型,参数量为数千亿级,与 Cerebras 合作以最高 950 tok/s 推理,比 Haiku 4.5 快 6 倍、比 Sonnet 4.5 快 13 倍,现已在 Windsurf 上线。
推荐理由:原文给出速度对比、SWE-Bench Pro 成绩和训练细节,读者可以据此评估这款高速编码模型是否改变现有工作流。
Cognition 发布 Windsurf Codemaps,由 SWE-1.5 和 Claude Sonnet 4.5 驱动的 AI 标注结构化代码地图,用于帮助工程师快速理解代码库。
Cognition 在 Devin 上线 18 个月之际发布年度绩效复盘,称其已进入数千家公司的工程团队,累计合并数十万个 PR。
推荐理由:Cognition 以自家客户数据和指标复盘 Devin 的强弱项,为评估智能体实际部署效果提供了可参照的框架。
Infosys 与 Cognition 达成合作,将在其组织内部及全球客户群中部署 AI 软件工程师 Devin,先在金融服务业务落地,覆盖银行、支付、资本市场、保险和财富管理场景,再扩展至零售、能源、医疗等行业。
Cognition 发布 Devin Review,一款面向 GitHub PR 的 AI 代码审查工具,认为代码审查已成为比代码生成更大的瓶颈。
推荐理由:原文给出了 Devin Review 的三种使用入口和具体功能细节,读者可以据此判断它如何改进自己的 PR 审查流程。
Cognition 在伦敦开设办公室,将自主软件工程推向欧洲领先企业。过去一年,全球多家大型金融机构已采用 Devin 覆盖 SDLC 工作,包括大规模现代化与迁移、安全漏洞修复以及复杂代码库文档化,Cognition 的合作伙伴包括 Goldman Sachs、Santander、Citi、BNY、HG Capital 和 The Access Group 等。
Cognizant 与 Cognition 达成合作,将在其工程组织和全球客户中部署 Devin 与 Windsurf。Cognizant 工程师已使用 Windsurf IDE 进行智能体辅助的流式编码,并正在探索 Devin 在代码迁移、重构、测试和维护等工程工作流中的自主端到端执行能力。
Cognition 为 Devin 推出 bot triggers 功能:Devin 可被配置为自动修复 Devin Review 及其他 review bot 在 PR 上留下的评论,并继续自动修复 lint 和 CI/CD 问题。
推荐理由:原文由官方说明功能配置入口和适用范围,读者可以判断它如何改变团队 PR 审查流程。
Cognition 发布 Devin 2.2,称其为 Devin 上线以来最重要的更新之一。Devin 现在可用自己的 Linux 桌面启动和测试桌面应用,PR 后可回传屏幕录制供人审查;同时能自审输出并自动修复问题,启动速度提升 3 倍,界面全面重构。新用户可获 $10 额度免费使用,新会话默认开启 Desktop 支持。
Cognition 推出 Cognition for Government,将 AI 软件工程平台引入美国联邦政府 IT 现代化。其 Devin 智能体可在云端并行执行数百个任务,迁移速度比人类工程师快 5-40 倍,现已上线 AWS GovCloud,FedRAMP High 授权版本即将推出。
Cognition 官方博客介绍其团队如何用 Devin 构建 Devin 本身:上周合并了 659 个 Devin 提交的 PR,高于 2025 年最佳单周的 154 个。