Cognition 发布 Devin 2025 年度绩效复盘:上线 18 个月的真实部署经验
Cognition 在 Devin 上线 18 个月之际发布年度绩效复盘,称其已进入数千家公司的工程团队,累计合并数十万个 PR。
推荐理由:Cognition 以自家客户数据和指标复盘 Devin 的强弱项,为评估智能体实际部署效果提供了可参照的框架。
Cognition 在 Devin 上线 18 个月之际发布年度绩效复盘,称其已进入数千家公司的工程团队,累计合并数十万个 PR。
推荐理由:Cognition 以自家客户数据和指标复盘 Devin 的强弱项,为评估智能体实际部署效果提供了可参照的框架。
Infosys 与 Cognition 达成合作,将在其组织内部及全球客户群中部署 AI 软件工程师 Devin,先在金融服务业务落地,覆盖银行、支付、资本市场、保险和财富管理场景,再扩展至零售、能源、医疗等行业。
Cognition 发布 Devin Review,一款面向 GitHub PR 的 AI 代码审查工具,认为代码审查已成为比代码生成更大的瓶颈。
推荐理由:原文给出了 Devin Review 的三种使用入口和具体功能细节,读者可以据此判断它如何改进自己的 PR 审查流程。
Cognition 在伦敦开设办公室,将自主软件工程推向欧洲领先企业。过去一年,全球多家大型金融机构已采用 Devin 覆盖 SDLC 工作,包括大规模现代化与迁移、安全漏洞修复以及复杂代码库文档化,Cognition 的合作伙伴包括 Goldman Sachs、Santander、Citi、BNY、HG Capital 和 The Access Group 等。
Cognizant 与 Cognition 达成合作,将在其工程组织和全球客户中部署 Devin 与 Windsurf。Cognizant 工程师已使用 Windsurf IDE 进行智能体辅助的流式编码,并正在探索 Devin 在代码迁移、重构、测试和维护等工程工作流中的自主端到端执行能力。
Cognition 为 Devin 推出 bot triggers 功能:Devin 可被配置为自动修复 Devin Review 及其他 review bot 在 PR 上留下的评论,并继续自动修复 lint 和 CI/CD 问题。
推荐理由:原文由官方说明功能配置入口和适用范围,读者可以判断它如何改变团队 PR 审查流程。
Cognition 发布 Devin 2.2,称其为 Devin 上线以来最重要的更新之一。Devin 现在可用自己的 Linux 桌面启动和测试桌面应用,PR 后可回传屏幕录制供人审查;同时能自审输出并自动修复问题,启动速度提升 3 倍,界面全面重构。新用户可获 $10 额度免费使用,新会话默认开启 Desktop 支持。
Cognition 推出 Cognition for Government,将 AI 软件工程平台引入美国联邦政府 IT 现代化。其 Devin 智能体可在云端并行执行数百个任务,迁移速度比人类工程师快 5-40 倍,现已上线 AWS GovCloud,FedRAMP High 授权版本即将推出。
Cognition 官方博客介绍其团队如何用 Devin 构建 Devin 本身:上周合并了 659 个 Devin 提交的 PR,高于 2025 年最佳单周的 154 个。
Cognition 宣布 Devin 可将大任务拆分并委派给多个受管理的 Devin 并行执行,每个子 Devin 在独立虚拟机中运行,拥有自己的终端、浏览器和开发环境。主 Devin 会话作为协调者负责拆分、分配、监控和汇总,并能读取子会话完整轨迹以改进后续任务拆分;同时支持向子会话发消息、监控 ACU 消耗、暂停或终止子会话。该功能现已向所有用户开放。
Cognition 宣布 Devin 可以调度自己的周期性会话:用户描述需求或让 Devin 完成一次任务后,直接告诉它按周期重复,Devin 会自行确定节奏并设置日程,无需配置 cron 或工作流工具。
Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型针对智能水平和模型 UX 联合训练,相比 Preview 减少了过度思考、循环行为和串行工具调用,更多使用并行工具调用;训练中引入长度惩罚以抑制过长轨迹。
Cognition 发文说明 Devin 在多家财富 500 强企业承担 COBOL 项目的做法与成效。文章指出 COBOL 对智能体的三大难点:业务数据靠内存位置而非命名关联、LLM 几乎没有 COBOL 训练语料、COBOL 依赖大型机导致反馈循环失效;应对方式是先用 DeepWiki 建立系统级代码地图,再用 playbook 编码领域约束。
Cognition 宣布成立 Cognition Japan,这是其首次进入亚洲市场,并任命在 IBM、Microsoft、Workday、Datadog Japan 任职过的 Takumi Masai 为日本总裁兼总经理。
Cognition 宣布更新 Devin 的自助定价,停用旧 Core 和 Team 套餐,推出 Free、Pro($20/月)、Max($200/月)、Teams(用量计费,最低 $80/月)和 Enterprise 五档,Team 入口从 $500/月降低。
Cognition 与 Applied Compute 合作 RL 训练了专用 bug 检测模型 SWE-check,在内部 in-distribution 评测中对 Opus 4.6 的 delta F1 从 0.09 降到 0,out-of-distribution 的 delta F1 从 0.49 降到 0.29,同时运行时间快约 10 倍且推理更便宜。
Cognition 发布 Devin in Windsurf,在 Windsurf 2.0 中内置本地与云端 Agent 协作流程。用户在 Windsurf 本地理解代码库并制定计划,一键发送给云端 Agent Devin 执行,Devin 自行启动机器、打开 PR、运行测试并用计算机视觉做 QA,用户可在 Windsurf 内查看 diff、跑测试或交回本地 Agent 修改。
Cognition 发布长文复盘,认为多智能体系统目前只在写入保持单线程、其他智能体贡献智能的模式下有效。
推荐理由:Cognition 一线团队复盘了真正跑通的多智能体模式,给出干净的审查上下文和单线程写入等可迁移经验。
Cognition 基于两年多构建 Devin 的经验,指出容器化方案存在共享内核安全风险,也无法跨异步间隙保存状态,他们用 microVM 隔离和 hypervisor 级全机状态快照解决。
Cognition 发布 Devin CLI,可把 Devin 作为本地编码智能体在终端运行,通过 curl -fsSL https://cli.devin.ai/install.sh | bash 一分钟内安装。
推荐理由:发布方自述了本地会话与云端接力的具体玩法,读者可以据此评估是否把它接入自己的终端工作流。
Mercedes-Benz 与 Cognition 达成合作,在全球工程团队部署 Devin 和 Windsurf,覆盖美国、欧洲和亚洲,是汽车行业规模最大的 AI 软件工程部署之一。
Cognition 发布博客,总结过去一年在多家车企(包括 RV Tech 和 Mercedes)部署 Devin 处理 HIL/SIL 工作流的经验。
Devin 现已支持启动 Android Virtual Device(AVD),可直接在自身机器上构建并运行 Android 应用,实现 Android 应用的自主开发。
Cognition 推出 Auto-Triage,现已在 Devin Automations 中可用。Devin 可监控 Slack、Linear、GitHub、Sentry、Datadog 及 webhook 等来源的告警,自动检查代码库和可观测性工具、并行派出 sub-Devin 调查、关联重复事故、标注负责人,并在修复明确时直接开 PR。
Cognition 宣布 Devin 现在可以在自己的 Windows VM 中原生构建、运行和测试代码,把云端自主 AI 工程能力带到 Windows 开发生态。
Cognition 宣布融资超 10 亿美元,估值 260 亿美元,由 Lux Capital、General Catalyst 和 8VC 领投。企业用量今年初以来增长超 10 倍,run-rate 收入达 4.92 亿美元;Mercedes-Benz 将八个月的遗留系统改造项目缩短到八天,Itaú 用 Devin 自动修复 70% 的安全漏洞。
推荐理由:原文由当事公司自述融资规模与业务数据,读者可以据此了解 Devin 的企业采用情况和自研模型进展。
Cognition 工程师分享 Devin 如何在云端虚拟机中自主验证自己的代码改动:Devin 通过截屏、点击、输入等 computer use 工具启动应用并点击测试,可 10 到 20 个并行运行。
Cognition 发布 Devin Desktop,定位为 Windsurf 的下一代版本,将 Agent Command Center 设为 IDE 默认界面,可从一处管理本地与云端 Agent、PR 和上下文。
推荐理由:官方完整说明了产品定位与 ACP 开放设计,读者可以据此判断它与现有 Windsurf 工作流的衔接方式。
Cognition 推出面向企业客户的 AI Productivity Guarantee,若 Devin 交付的工程价值低于客户付费,Cognition 将资助其使用直到达标,赔付上限 $10M。
Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。
Cognition 推出 Devin Fusion 预览,一个混合模型 harness,通过并行前沿模型与低成本 sidekick 智能体、以及基于轻量分类器在上下文压缩时动态切换模型。
推荐理由:官方披露了 sidekick 双智能体与中途动态路由两类可参考的降本架构,并给出 FrontierCode 上的成本与性能数据。
Cognition 发布 Devin Security Swarm,可扫描代码库发现漏洞、在运行时验证可利用性并提交修复 PR。它用并行 Agent 跨文件推理业务逻辑缺陷和链式攻击路径,在隔离沙箱中复现后开 PR。
Cognition 推出 Devin 安全漏洞修复计划,由其前置工程团队与客户团队协作部署 AI 软件工程师 Devin,先批量清理已知漏洞,再通过 Devin Security Swarm 持续发现并修复逻辑缺陷等扫描器遗漏的问题。
Cognition 发布 FrontierCode 1.1,通过“公平使用互联网”提示词与程序化检测两项措施,将各模型的不公平联网行为降至 1% 以下。该版本还审计了 1000+ 条评分标准并放宽其中 75 条过严项,新增 Sonnet 5 分数并更新 Fable 5,此后仅报告 Main 与 Extended 子集,不再报告 Diamond 子集。
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。
Cognition 整个平台已进入 FedRAMP Class D (High) In-Process 并列入 FedRAMP Marketplace,使联邦环境中的工程团队可用上自主云端 AI 软件工程师 Devin。
卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。
Cognition 在 FrontierCode 1.1 上跑了 3000 次评测,发现尽管 Fable 5 每 token 价格是 Opus 4.8 的 2 倍,配合 Sidekick 时反而更便宜且得分更高(60.7 vs 54.6,$1.86 vs $2.04),比纯 Fable 省 54% 成本。
Cognition 与 Windsurf 合并一年后,Devin 已从初级工程师成长为可调度、管理其他 Devin 的中高级水平,并能通过 computer use 自测、自验证和自动修复。
Cohere Labs 发布“Future(s) of Work”研究专题,探讨 AI 对工作方式的影响,并指出当前关于未来工作的讨论存在证据不足的问题。该专题推出 Agentic Task Ecosystem(ATE)数据集,基于 7 个目录中的 123,000 个公开 MCP 服务器,分析了 694,000+ 个可执行工具,将 AI 工具映射到真实职业任务。