Devin 支持自动修复 Review 评论,闭环代码审查流程
Cognition 为 Devin 推出 bot triggers 功能:Devin 可被配置为自动修复 Devin Review 及其他 review bot 在 PR 上留下的评论,并继续自动修复 lint 和 CI/CD 问题。
推荐理由:原文由官方说明功能配置入口和适用范围,读者可以判断它如何改变团队 PR 审查流程。
Cognition 为 Devin 推出 bot triggers 功能:Devin 可被配置为自动修复 Devin Review 及其他 review bot 在 PR 上留下的评论,并继续自动修复 lint 和 CI/CD 问题。
推荐理由:原文由官方说明功能配置入口和适用范围,读者可以判断它如何改变团队 PR 审查流程。
Cognition 发布 Devin 2.2,称其为 Devin 上线以来最重要的更新之一。Devin 现在可用自己的 Linux 桌面启动和测试桌面应用,PR 后可回传屏幕录制供人审查;同时能自审输出并自动修复问题,启动速度提升 3 倍,界面全面重构。新用户可获 $10 额度免费使用,新会话默认开启 Desktop 支持。
Cognition 推出 Cognition for Government,将 AI 软件工程平台引入美国联邦政府 IT 现代化。其 Devin 智能体可在云端并行执行数百个任务,迁移速度比人类工程师快 5-40 倍,现已上线 AWS GovCloud,FedRAMP High 授权版本即将推出。
Cognition 官方博客介绍其团队如何用 Devin 构建 Devin 本身:上周合并了 659 个 Devin 提交的 PR,高于 2025 年最佳单周的 154 个。
Cognition 分享正在训练中的 SWE-1.6 早期预览:当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%(51.7% 对 40.1%),推理速度同为 950 tok/s,并向小部分用户开放早期访问。
Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型针对智能水平和模型 UX 联合训练,相比 Preview 减少了过度思考、循环行为和串行工具调用,更多使用并行工具调用;训练中引入长度惩罚以抑制过长轨迹。
Cognition 发文说明 Devin 在多家财富 500 强企业承担 COBOL 项目的做法与成效。文章指出 COBOL 对智能体的三大难点:业务数据靠内存位置而非命名关联、LLM 几乎没有 COBOL 训练语料、COBOL 依赖大型机导致反馈循环失效;应对方式是先用 DeepWiki 建立系统级代码地图,再用 playbook 编码领域约束。
Cognition 宣布更新 Devin 的自助定价,停用旧 Core 和 Team 套餐,推出 Free、Pro($20/月)、Max($200/月)、Teams(用量计费,最低 $80/月)和 Enterprise 五档,Team 入口从 $500/月降低。
Cognition 与 Applied Compute 合作 RL 训练了专用 bug 检测模型 SWE-check,在内部 in-distribution 评测中对 Opus 4.6 的 delta F1 从 0.09 降到 0,out-of-distribution 的 delta F1 从 0.49 降到 0.29,同时运行时间快约 10 倍且推理更便宜。
Cognition 发布 Devin in Windsurf,在 Windsurf 2.0 中内置本地与云端 Agent 协作流程。用户在 Windsurf 本地理解代码库并制定计划,一键发送给云端 Agent Devin 执行,Devin 自行启动机器、打开 PR、运行测试并用计算机视觉做 QA,用户可在 Windsurf 内查看 diff、跑测试或交回本地 Agent 修改。
Cognition 发布长文复盘,认为多智能体系统目前只在写入保持单线程、其他智能体贡献智能的模式下有效。
推荐理由:Cognition 一线团队复盘了真正跑通的多智能体模式,给出干净的审查上下文和单线程写入等可迁移经验。
Cognition 发布 Devin CLI,可把 Devin 作为本地编码智能体在终端运行,通过 curl -fsSL https://cli.devin.ai/install.sh | bash 一分钟内安装。
推荐理由:发布方自述了本地会话与云端接力的具体玩法,读者可以据此评估是否把它接入自己的终端工作流。
Mercedes-Benz 与 Cognition 达成合作,在全球工程团队部署 Devin 和 Windsurf,覆盖美国、欧洲和亚洲,是汽车行业规模最大的 AI 软件工程部署之一。
Cognition 在新加坡开设亚太总部,由副总裁兼亚太区总经理 Richard Spence 领导,覆盖东南亚、澳大利亚、印度和韩国市场。新加坡企业 OCBC 使用其平台后,代码与测试用例生成效率提升最高 30%,系统集成测试首次通过率从不足 50% 升至 80% 以上。Cognition 已在东京和新加坡部署团队,并正招聘工程、市场与合作伙伴岗位。
Devin 现已支持启动 Android Virtual Device(AVD),可直接在自身机器上构建并运行 Android 应用,实现 Android 应用的自主开发。
Cognition 宣布 Devin 现在可以在自己的 Windows VM 中原生构建、运行和测试代码,把云端自主 AI 工程能力带到 Windows 开发生态。
Cognition 宣布融资超 10 亿美元,估值 260 亿美元,由 Lux Capital、General Catalyst 和 8VC 领投。企业用量今年初以来增长超 10 倍,run-rate 收入达 4.92 亿美元;Mercedes-Benz 将八个月的遗留系统改造项目缩短到八天,Itaú 用 Devin 自动修复 70% 的安全漏洞。
推荐理由:原文由当事公司自述融资规模与业务数据,读者可以据此了解 Devin 的企业采用情况和自研模型进展。
Cognition 工程师分享 Devin 如何在云端虚拟机中自主验证自己的代码改动:Devin 通过截屏、点击、输入等 computer use 工具启动应用并点击测试,可 10 到 20 个并行运行。
Cognition 发布 Devin Desktop,定位为 Windsurf 的下一代版本,将 Agent Command Center 设为 IDE 默认界面,可从一处管理本地与云端 Agent、PR 和上下文。
推荐理由:官方完整说明了产品定位与 ACP 开放设计,读者可以据此判断它与现有 Windsurf 工作流的衔接方式。
Cognition 推出面向企业客户的 AI Productivity Guarantee,若 Devin 交付的工程价值低于客户付费,Cognition 将资助其使用直到达标,赔付上限 $10M。
Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。
Cognition 发布 FrontierCode 基准,从正确性、测试质量、范围纪律、风格等维度评估模型代码能否达到开源维护者可合并的标准,误报率比 SWE-Bench Pro 低 81%。
Cognition 推出 Devin Fusion 预览,一个混合模型 harness,通过并行前沿模型与低成本 sidekick 智能体、以及基于轻量分类器在上下文压缩时动态切换模型。
推荐理由:官方披露了 sidekick 双智能体与中途动态路由两类可参考的降本架构,并给出 FrontierCode 上的成本与性能数据。
Cognition 发布 Devin Security Swarm,可扫描代码库发现漏洞、在运行时验证可利用性并提交修复 PR。它用并行 Agent 跨文件推理业务逻辑缺陷和链式攻击路径,在隔离沙箱中复现后开 PR。
Cognition 发布 FrontierCode 1.1,通过“公平使用互联网”提示词与程序化检测两项措施,将各模型的不公平联网行为降至 1% 以下。该版本还审计了 1000+ 条评分标准并放宽其中 75 条过严项,新增 Sonnet 5 分数并更新 Fable 5,此后仅报告 Main 与 Extended 子集,不再报告 Diamond 子集。
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。
Cognition 整个平台已进入 FedRAMP Class D (High) In-Process 并列入 FedRAMP Marketplace,使联邦环境中的工程团队可用上自主云端 AI 软件工程师 Devin。
Cognition 在 FrontierCode 1.1 上跑了 3000 次评测,发现尽管 Fable 5 每 token 价格是 Opus 4.8 的 2 倍,配合 Sidekick 时反而更便宜且得分更高(60.7 vs 54.6,$1.86 vs $2.04),比纯 Fable 省 54% 成本。
Cognition 与 Windsurf 合并一年后,Devin 已从初级工程师成长为可调度、管理其他 Devin 的中高级水平,并能通过 computer use 自测、自验证和自动修复。
Cognition 宣布收购 TierZero,TierZero 团队 Anhang 和 Yun 加入 Cognition,其自动化(automations)工作将被引入 Devin。Cognition 表示,双方希望让工程师减少处理线上故障的时间,把更多精力投入构建。
Trail of Bits 在 Testing Handbook 中新增 C/C++ 安全审查清单章节,覆盖通用 bug 类别、Linux 用户态与内核、Windows 用户态与内核、seccomp/BPF 沙箱五部分,包括 libc 陷阱、DLL planting、WorstFit Unicode 问题、io_uring 沙箱绕过等。
Trail of Bits 开源 Trailmark,一个将源码解析为可查询调用图(函数、类、调用关系与语义元数据)的库,支持 17 种语言,通过 Python API 供 Claude 技能直接调用,并同步发布 8 个 Claude Code 技能用于突变分诊、测试向量生成、协议图等。
Trail of Bits 公布 Windows 驱动注册表处理程序挑战的完整分析,指出缺失 RTL_QUERY_REGISTRY_TYPECHECK 标志导致的注册表类型混淆可从本地拒绝服务升级为内核写原语。
Trail of Bits 发布 gosentry,一个面向 fuzzing 的 Go 工具链 fork,让 go test -fuzz 默认使用 LibAFL,同时保留 testing.F 工作流和现有 harness API。
Trail of Bits 在与 OpenAI 合作的 Patch the Planet 项目中,将 GPT-5.5-Cyber 通过 Codex 的 /goal 命令指向 zlib,模型在一天内自主搭建了覆盖十几个入口点的 fuzzing 实验,包括 ASan/UBSan 构建、种子语料和编译期变体构建,并发现多个问题正在进行协调披露。
推荐理由:一线安全团队实测 GPT-5.5-Cyber 自主搭建 zlib fuzzing 实验室,给出 harness 构建细节和报告有效性规则等可迁移经验。
Trail of Bits 为 Testing Handbook 新增 Rust 安全测试章节,覆盖动态分析(Miri、proptest、变异测试)、Clippy 静态分析、内存零化与 Kani 模型检查等工具链。
Trail of Bits 在与 OpenAI 合作的 Patch the Planet 项目中,用 Codex 的 /goal 对 Rust、curl、zlib 等代码库挖洞,找到了 Rust 1.98 已修复的 soundness 漏洞和误编译、11 处变体命中,以及 Keycloak SAML 的两个潜在高危提权漏洞。
推荐理由:原文来自亲历团队,给出了 /goal 挖漏洞的三条可迁移技巧和 Rust 变体分析流水线,读者可以照此改进自己的 Agent 审计流程。
Augment Code 提出 AI 原生转型分四个阶段:约 70% 组织仍停留在第一阶段(将智能体接入日常工作流),不到 10% 让智能体自主拥有工作,几乎无人达到第四阶段全智能体编排。在软件开发生命周期六个环节中,代码生成、验证、构建失败诊断三个环节已由智能体主导,代码审查中低风险改动可自动批准。某企业客户开发者每周因代码审查阻塞的时间占比从 30% 降至 10% 以下。
Augment Code 本月在 Claude 和 GPT-5 之外新增 Gemini 3.1 Pro,成为其第三个可选模型,并称单模型工程时代已经结束。过去十三个月里领先模型三次易主,GPT-5.4 的每条消息价格比此前所用模型便宜约 2.6 倍。其做法是把模型、harness(Context Engine)与编排层(Intent)解耦,切换模型只需改一个设置而非迁移。
Augment Code 用内部评测 AuggieBench 测量数十个 AGENTS.md 对代码生成的影响,最好的文件带来相当于从 Haiku 升级到 Opus 的质量提升,最差的比没有文件更糟。
推荐理由:作者基于内部评测给出了 AGENTS.md 的可用与失效模式,读者可以按自身模块选择对应写法。