Cognition 在新加坡设立亚太总部,Devin 加速亚太企业落地
Cognition 在新加坡开设亚太总部,由副总裁兼亚太区总经理 Richard Spence 领导,覆盖东南亚、澳大利亚、印度和韩国市场。新加坡企业 OCBC 使用其平台后,代码与测试用例生成效率提升最高 30%,系统集成测试首次通过率从不足 50% 升至 80% 以上。Cognition 已在东京和新加坡部署团队,并正招聘工程、市场与合作伙伴岗位。
Cognition 在新加坡开设亚太总部,由副总裁兼亚太区总经理 Richard Spence 领导,覆盖东南亚、澳大利亚、印度和韩国市场。新加坡企业 OCBC 使用其平台后,代码与测试用例生成效率提升最高 30%,系统集成测试首次通过率从不足 50% 升至 80% 以上。Cognition 已在东京和新加坡部署团队,并正招聘工程、市场与合作伙伴岗位。
Cognition 发布博客,总结过去一年在多家车企(包括 RV Tech 和 Mercedes)部署 Devin 处理 HIL/SIL 工作流的经验。
Devin 现已支持启动 Android Virtual Device(AVD),可直接在自身机器上构建并运行 Android 应用,实现 Android 应用的自主开发。
Cognition 推出 Auto-Triage,现已在 Devin Automations 中可用。Devin 可监控 Slack、Linear、GitHub、Sentry、Datadog 及 webhook 等来源的告警,自动检查代码库和可观测性工具、并行派出 sub-Devin 调查、关联重复事故、标注负责人,并在修复明确时直接开 PR。
Cognition 宣布 Devin 现在可以在自己的 Windows VM 中原生构建、运行和测试代码,把云端自主 AI 工程能力带到 Windows 开发生态。
Cognition 宣布融资超 10 亿美元,估值 260 亿美元,由 Lux Capital、General Catalyst 和 8VC 领投。企业用量今年初以来增长超 10 倍,run-rate 收入达 4.92 亿美元;Mercedes-Benz 将八个月的遗留系统改造项目缩短到八天,Itaú 用 Devin 自动修复 70% 的安全漏洞。
推荐理由:原文由当事公司自述融资规模与业务数据,读者可以据此了解 Devin 的企业采用情况和自研模型进展。
Cognition 工程师分享 Devin 如何在云端虚拟机中自主验证自己的代码改动:Devin 通过截屏、点击、输入等 computer use 工具启动应用并点击测试,可 10 到 20 个并行运行。
Cognition 发布 Devin Desktop,定位为 Windsurf 的下一代版本,将 Agent Command Center 设为 IDE 默认界面,可从一处管理本地与云端 Agent、PR 和上下文。
推荐理由:官方完整说明了产品定位与 ACP 开放设计,读者可以据此判断它与现有 Windsurf 工作流的衔接方式。
Cognition 推出面向企业客户的 AI Productivity Guarantee,若 Devin 交付的工程价值低于客户付费,Cognition 将资助其使用直到达标,赔付上限 $10M。
Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。
Cognition 发布 FrontierCode 基准,从正确性、测试质量、范围纪律、风格等维度评估模型代码能否达到开源维护者可合并的标准,误报率比 SWE-Bench Pro 低 81%。
Cognition 推出 Devin Fusion 预览,一个混合模型 harness,通过并行前沿模型与低成本 sidekick 智能体、以及基于轻量分类器在上下文压缩时动态切换模型。
推荐理由:官方披露了 sidekick 双智能体与中途动态路由两类可参考的降本架构,并给出 FrontierCode 上的成本与性能数据。
Cognition 发布 Devin Security Swarm,可扫描代码库发现漏洞、在运行时验证可利用性并提交修复 PR。它用并行 Agent 跨文件推理业务逻辑缺陷和链式攻击路径,在隔离沙箱中复现后开 PR。
Cognition 推出 Devin 安全漏洞修复计划,由其前置工程团队与客户团队协作部署 AI 软件工程师 Devin,先批量清理已知漏洞,再通过 Devin Security Swarm 持续发现并修复逻辑缺陷等扫描器遗漏的问题。
Cognition 发布 FrontierCode 1.1,通过“公平使用互联网”提示词与程序化检测两项措施,将各模型的不公平联网行为降至 1% 以下。该版本还审计了 1000+ 条评分标准并放宽其中 75 条过严项,新增 Sonnet 5 分数并更新 Fable 5,此后仅报告 Main 与 Extended 子集,不再报告 Diamond 子集。
Baseten 公布适用于 Dedicated Inference 和 Model APIs 的服务等级协议,承诺每月 System Availability 不低于 99.9%,按月度监控记录计算。未达标时客户可申请服务补偿,单月补偿上限为当月应付费用的 40%,且需自行发邮件申请。该 SLA 不适用于客户自托管部署的服务。
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。
Baseten Labs, Inc. 发布服务条款,界定其作为推理平台提供方的角色与责任边界。条款明确 Baseten 仅提供基础设施、部署、优化与编排服务,不控制 Customer Model 或 Third-Party Products 的设计、训练与输出,也不承担其准确性、安全性、偏见或合规责任。AI 系统开发、部署与分发的法律合规责任由 Customer 承担。
Baseten 提供 Baseten Inference Stack,用于构建产品级或内部编码智能体,并支持高性能、可扩展、低成本地部署和推理 AI 模型,可运行在 Baseten 云端或用户自有环境。页面引导用户联系其产品专家了解具体方案。
Cognition 整个平台已进入 FedRAMP Class D (High) In-Process 并列入 FedRAMP Marketplace,使联邦环境中的工程团队可用上自主云端 AI 软件工程师 Devin。
卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。
Cognition 在 FrontierCode 1.1 上跑了 3000 次评测,发现尽管 Fable 5 每 token 价格是 Opus 4.8 的 2 倍,配合 Sidekick 时反而更便宜且得分更高(60.7 vs 54.6,$1.86 vs $2.04),比纯 Fable 省 54% 成本。
Baseten 正在招聘跨学科团队,构建其所谓的“推理云”(Inference Cloud),认为 AI 的未来是数百万个专用模型嵌入各类产品,而推理决定性能、可靠性、延迟与经济性。Abridge、Cursor、Lovable、Notion、OpenEvidence 等公司已依赖 Baseten 支撑生产环境的 AI 工作负载。
Cognition 与 Windsurf 合并一年后,Devin 已从初级工程师成长为可调度、管理其他 Devin 的中高级水平,并能通过 computer use 自测、自验证和自动修复。
Cohere Labs 的 Research Scholars 计划旨在寻找新一代机器学习人才,目前该项目申请通道已关闭。官方建议有意者加入其 Open Science 社区,与团队和社区成员协作。
Baseten 面向 AI 初创公司推出 Startup Program,提供最高 25,000 美元 Dedicated Inference 或 Training 额度,以及最高 2,500 美元 Model APIs 额度。申请者须为 AI 为核心业务的种子轮到 A 轮公司、成立不满 5 年,且此前未获得过 Baseten 额度。入选者还可获得数小时响应支持、跨云自动扩缩容与 GTM 支持。
Cognition 宣布收购 TierZero,TierZero 团队 Anhang 和 Yun 加入 Cognition,其自动化(automations)工作将被引入 Devin。Cognition 表示,双方希望让工程师减少处理线上故障的时间,把更多精力投入构建。
Cohere Labs 发布“Future(s) of Work”研究专题,探讨 AI 对工作方式的影响,并指出当前关于未来工作的讨论存在证据不足的问题。该专题推出 Agentic Task Ecosystem(ATE)数据集,基于 7 个目录中的 123,000 个公开 MCP 服务器,分析了 694,000+ 个可执行工具,将 AI 工具映射到真实职业任务。
Baseten 为生产级 AI 推理提供全栈工程能力,覆盖模型开发、服务、编排、可观测性与底层优化,目标是在真实流量下兼顾吞吐、延迟与可靠性。其基础设施支持跨云跨区域 99.99% 可用性,并通过内核、量化、批处理、路由与硬件选型等逐层调优,按模型与流量定制配置而非套用通用预设。公司 2019 年由工程师创立,以前向部署工程师(FDE)与客户在真实流量下共同调优,从原型一路做到生产规模。
Cognition 宣布与美国能源部(DOE)签署谅解备忘录,加入被称为“美国 AI 曼哈顿计划”的 Genesis Mission,该计划于 2025 年 11 月由行政命令启动,目标是十年内让美国科研生产力翻倍。
Cohere 发布 Embed 5 系列嵌入模型,含 Embed 5 Pro 和 Embed 5 Fast 两档,均支持 128K token 上下文、100+ 语言、文本与图像输入和共享嵌入空间,定价分别为每百万 token $0.12 和 $0.08。
Baseten 上线 Trust Center,集中公开其安全、隐私与合规资料,涵盖 SOC 2、ISO 27001:2022、HIPAA、CCPA、GDPR、PCI DSS 等认证与问卷文档。该页面同时列出子处理商名单,近期新增 Mistral AI、Global AI、Parallel AI、QumulusAI 和 Argentum AI,分别用于云算力与网页搜索。
Cognition 宣布收购 The Interaction Company of California,即个人智能体应用 Poke 的开发团队。Poke 是一款通过短信主动与用户互动的个人智能体,近三个月用户与它交换了超过 1 亿条消息,也是唯一获准在 Apple Messages 上原生发短信的 AI 智能体。
Baseten 上线成本计算器,可在 Baseten Model APIs 上对比闭源 API 支出与开源模型的费用,并预估节省金额。估算基于输入与输出 token 用量及大致缓存命中率,结果仅为内部讨论用的一般性估算,Baseten 不保证实际节省金额。
Cohere 推出 Embed 5 系列前沿嵌入模型,是其迄今最强的嵌入模型,现已提供 Pro 和 Fast 两个档位。同期 Cohere 还发布 North Small Translate 开源权重机器翻译模型,并提出衡量企业检索质量的 RCP-nDCG@10 新指标。
LTM 与 Cognition 达成合作,将在其全球客户群和网络安全业务中部署 AI 软件工程师 Devin,服务超 260 家客户,包括 26 家 Fortune 500 企业和全球前 5 大银行。
Baseten 正在与多元化的技术与解决方案合作伙伴生态协作,推进 AI 能力边界。该公司表示持续探索推动创新、促进 AI 社区发展的机会,并邀请有合作意向的伙伴与其联系共建。
Baseten 每周为 OpenEvidence 支撑数十亿次定制、微调 LLM 调用,向全美各大医疗机构提供高风险医疗信息。Baseten 称其可靠性与大规模深度支持已足以承担这一有时关乎生死的任务。此外,Baseten 与合作伙伴将说话人识别智能层直接前置到构建下一代 Voice AI 的开发者面前。
Baseten 每周为 OpenEvidence 支撑数十亿次定制、微调的 LLM 调用,向全美各大医疗机构提供高风险医疗信息。其可靠性投入被证明足以承担这一有时关乎生死的任务,同时 Baseten 将说话人识别层直接前置给构建下一代 Voice AI 的开发者。
Baseten 宣布自 10 月 1 日 15:00 UTC 起新建 API key 将加 b10_ 前缀,便于在代码、日志和密钥扫描器中识别。Hosted Tools 通过 Baseten Grounded Inference 为 Model APIs 引入服务端联网搜索,可经 Exa、Keenable、Parallel 或 You.com 检索并抓取实时网页内容。