Cognition 发布 Devin Desktop,作为 Windsurf 下一代版本
Cognition 发布 Devin Desktop,定位为 Windsurf 的下一代版本,将 Agent Command Center 设为 IDE 默认界面,可从一处管理本地与云端 Agent、PR 和上下文。
推荐理由:官方完整说明了产品定位与 ACP 开放设计,读者可以据此判断它与现有 Windsurf 工作流的衔接方式。
Cognition 发布 Devin Desktop,定位为 Windsurf 的下一代版本,将 Agent Command Center 设为 IDE 默认界面,可从一处管理本地与云端 Agent、PR 和上下文。
推荐理由:官方完整说明了产品定位与 ACP 开放设计,读者可以据此判断它与现有 Windsurf 工作流的衔接方式。
Cognition 推出面向企业客户的 AI Productivity Guarantee,若 Devin 交付的工程价值低于客户付费,Cognition 将资助其使用直到达标,赔付上限 $10M。
Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。
Cognition 发布 FrontierCode 基准,从正确性、测试质量、范围纪律、风格等维度评估模型代码能否达到开源维护者可合并的标准,误报率比 SWE-Bench Pro 低 81%。
Cognition 推出 Devin Fusion 预览,一个混合模型 harness,通过并行前沿模型与低成本 sidekick 智能体、以及基于轻量分类器在上下文压缩时动态切换模型。
推荐理由:官方披露了 sidekick 双智能体与中途动态路由两类可参考的降本架构,并给出 FrontierCode 上的成本与性能数据。
Cognition 发布 Devin Security Swarm,可扫描代码库发现漏洞、在运行时验证可利用性并提交修复 PR。它用并行 Agent 跨文件推理业务逻辑缺陷和链式攻击路径,在隔离沙箱中复现后开 PR。
Cognition 推出 Devin 安全漏洞修复计划,由其前置工程团队与客户团队协作部署 AI 软件工程师 Devin,先批量清理已知漏洞,再通过 Devin Security Swarm 持续发现并修复逻辑缺陷等扫描器遗漏的问题。
Cognition 发布 FrontierCode 1.1,通过“公平使用互联网”提示词与程序化检测两项措施,将各模型的不公平联网行为降至 1% 以下。该版本还审计了 1000+ 条评分标准并放宽其中 75 条过严项,新增 Sonnet 5 分数并更新 Fable 5,此后仅报告 Main 与 Extended 子集,不再报告 Diamond 子集。
Baseten 公布适用于 Dedicated Inference 和 Model APIs 的服务等级协议,承诺每月 System Availability 不低于 99.9%,按月度监控记录计算。未达标时客户可申请服务补偿,单月补偿上限为当月应付费用的 40%,且需自行发邮件申请。该 SLA 不适用于客户自托管部署的服务。
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。
Baseten Labs, Inc. 发布服务条款,界定其作为推理平台提供方的角色与责任边界。条款明确 Baseten 仅提供基础设施、部署、优化与编排服务,不控制 Customer Model 或 Third-Party Products 的设计、训练与输出,也不承担其准确性、安全性、偏见或合规责任。AI 系统开发、部署与分发的法律合规责任由 Customer 承担。
Baseten 提供 Baseten Inference Stack,用于构建产品级或内部编码智能体,并支持高性能、可扩展、低成本地部署和推理 AI 模型,可运行在 Baseten 云端或用户自有环境。页面引导用户联系其产品专家了解具体方案。
Cognition 整个平台已进入 FedRAMP Class D (High) In-Process 并列入 FedRAMP Marketplace,使联邦环境中的工程团队可用上自主云端 AI 软件工程师 Devin。
卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。
Cognition 在 FrontierCode 1.1 上跑了 3000 次评测,发现尽管 Fable 5 每 token 价格是 Opus 4.8 的 2 倍,配合 Sidekick 时反而更便宜且得分更高(60.7 vs 54.6,$1.86 vs $2.04),比纯 Fable 省 54% 成本。
Baseten 正在招聘跨学科团队,构建其所谓的“推理云”(Inference Cloud),认为 AI 的未来是数百万个专用模型嵌入各类产品,而推理决定性能、可靠性、延迟与经济性。Abridge、Cursor、Lovable、Notion、OpenEvidence 等公司已依赖 Baseten 支撑生产环境的 AI 工作负载。
Cognition 与 Windsurf 合并一年后,Devin 已从初级工程师成长为可调度、管理其他 Devin 的中高级水平,并能通过 computer use 自测、自验证和自动修复。
Cohere Labs 的 Research Scholars 计划旨在寻找新一代机器学习人才,目前该项目申请通道已关闭。官方建议有意者加入其 Open Science 社区,与团队和社区成员协作。
Baseten 面向 AI 初创公司推出 Startup Program,提供最高 25,000 美元 Dedicated Inference 或 Training 额度,以及最高 2,500 美元 Model APIs 额度。申请者须为 AI 为核心业务的种子轮到 A 轮公司、成立不满 5 年,且此前未获得过 Baseten 额度。入选者还可获得数小时响应支持、跨云自动扩缩容与 GTM 支持。
Cognition 宣布收购 TierZero,TierZero 团队 Anhang 和 Yun 加入 Cognition,其自动化(automations)工作将被引入 Devin。Cognition 表示,双方希望让工程师减少处理线上故障的时间,把更多精力投入构建。
Cohere Labs 发布“Future(s) of Work”研究专题,探讨 AI 对工作方式的影响,并指出当前关于未来工作的讨论存在证据不足的问题。该专题推出 Agentic Task Ecosystem(ATE)数据集,基于 7 个目录中的 123,000 个公开 MCP 服务器,分析了 694,000+ 个可执行工具,将 AI 工具映射到真实职业任务。
Baseten 为生产级 AI 推理提供全栈工程能力,覆盖模型开发、服务、编排、可观测性与底层优化,目标是在真实流量下兼顾吞吐、延迟与可靠性。其基础设施支持跨云跨区域 99.99% 可用性,并通过内核、量化、批处理、路由与硬件选型等逐层调优,按模型与流量定制配置而非套用通用预设。公司 2019 年由工程师创立,以前向部署工程师(FDE)与客户在真实流量下共同调优,从原型一路做到生产规模。
Cognition 宣布与美国能源部(DOE)签署谅解备忘录,加入被称为“美国 AI 曼哈顿计划”的 Genesis Mission,该计划于 2025 年 11 月由行政命令启动,目标是十年内让美国科研生产力翻倍。
Cohere 发布 Embed 5 系列嵌入模型,含 Embed 5 Pro 和 Embed 5 Fast 两档,均支持 128K token 上下文、100+ 语言、文本与图像输入和共享嵌入空间,定价分别为每百万 token $0.12 和 $0.08。
Baseten 上线 Trust Center,集中公开其安全、隐私与合规资料,涵盖 SOC 2、ISO 27001:2022、HIPAA、CCPA、GDPR、PCI DSS 等认证与问卷文档。该页面同时列出子处理商名单,近期新增 Mistral AI、Global AI、Parallel AI、QumulusAI 和 Argentum AI,分别用于云算力与网页搜索。
Cognition 宣布收购 The Interaction Company of California,即个人智能体应用 Poke 的开发团队。Poke 是一款通过短信主动与用户互动的个人智能体,近三个月用户与它交换了超过 1 亿条消息,也是唯一获准在 Apple Messages 上原生发短信的 AI 智能体。
Baseten 上线成本计算器,可在 Baseten Model APIs 上对比闭源 API 支出与开源模型的费用,并预估节省金额。估算基于输入与输出 token 用量及大致缓存命中率,结果仅为内部讨论用的一般性估算,Baseten 不保证实际节省金额。
Cohere 推出 Embed 5 系列前沿嵌入模型,是其迄今最强的嵌入模型,现已提供 Pro 和 Fast 两个档位。同期 Cohere 还发布 North Small Translate 开源权重机器翻译模型,并提出衡量企业检索质量的 RCP-nDCG@10 新指标。
LTM 与 Cognition 达成合作,将在其全球客户群和网络安全业务中部署 AI 软件工程师 Devin,服务超 260 家客户,包括 26 家 Fortune 500 企业和全球前 5 大银行。
Baseten 正在与多元化的技术与解决方案合作伙伴生态协作,推进 AI 能力边界。该公司表示持续探索推动创新、促进 AI 社区发展的机会,并邀请有合作意向的伙伴与其联系共建。
Baseten 每周为 OpenEvidence 支撑数十亿次定制、微调 LLM 调用,向全美各大医疗机构提供高风险医疗信息。Baseten 称其可靠性与大规模深度支持已足以承担这一有时关乎生死的任务。此外,Baseten 与合作伙伴将说话人识别智能层直接前置到构建下一代 Voice AI 的开发者面前。
Baseten 每周为 OpenEvidence 支撑数十亿次定制、微调的 LLM 调用,向全美各大医疗机构提供高风险医疗信息。其可靠性投入被证明足以承担这一有时关乎生死的任务,同时 Baseten 将说话人识别层直接前置给构建下一代 Voice AI 的开发者。
Trail of Bits 在 Testing Handbook 中新增 C/C++ 安全审查清单章节,覆盖通用 bug 类别、Linux 用户态与内核、Windows 用户态与内核、seccomp/BPF 沙箱五部分,包括 libc 陷阱、DLL planting、WorstFit Unicode 问题、io_uring 沙箱绕过等。
Baseten 宣布自 10 月 1 日 15:00 UTC 起新建 API key 将加 b10_ 前缀,便于在代码、日志和密钥扫描器中识别。Hosted Tools 通过 Baseten Grounded Inference 为 Model APIs 引入服务端联网搜索,可经 Exa、Keenable、Parallel 或 You.com 检索并抓取实时网页内容。
Trail of Bits 发布一份零知识证明,在所有指标上超过 Google 两周前发布的椭圆曲线量子密码分析证明:830 万总操作数、1,164 个 qubit、报告的 Toffoli 门数为 0。
Baseten 推出面向医疗健康行业的 AI 推理基础设施,支持数字前台、健康聊天机器人和医疗记录员等场景。平台符合 SOC-2 Type II 与 HIPAA 合规要求,提供 99.99% 可用性和跨 10+ 云的统一 GPU 池,支持 Baseten Cloud、自托管或 Baseten Hybrid 部署,并按分钟计费、自动缩容至零。
Trail of Bits 开源 Trailmark,一个将源码解析为可查询调用图(函数、类、调用关系与语义元数据)的库,支持 17 种语言,通过 Python API 供 Claude 技能直接调用,并同步发布 8 个 Claude Code 技能用于突变分诊、测试向量生成、协议图等。
Baseten 面向企业提供关键任务推理平台,支持在 Baseten Cloud 或自有云基础设施中部署,Baseten Cloud 提供单租户集群,自托管方案可在 VPC 故障时自动故障转移至 Baseten Cloud。
Trail of Bits 为纯 Ruby 代码与 Ruby C 扩展的覆盖率引导模糊测试器 Ruzzy 增加了 LibAFL 支持,让 Ruby 开发者无需改动 harness 写法即可换用更活跃的模糊测试引擎。
Baseten 上线 Embeddings 服务,可用任意嵌入模型快速处理数百万数据点,支持自定义 Docker 镜像、Truss 库和 Baseten Chains。该服务覆盖 BGE、Stella、SFR-Embedding、Nomic、NV-Embed、Voyage 等模型系列,面向语义搜索与推荐系统,提供五个 9 可用性、优化冷启动和弹性自动扩缩容,可缩容至零以节省成本。