Cursor 推出构建,云端智能体启动速度最快提升至 3 倍
Cursor 推出构建功能,在后台预先准备可直接使用的开发环境副本,智能体启动即可运行,无需额外费用。默认每小时创建一次新构建,环境损坏时智能体沿用上一次成功构建;Cursor 内部环境启动速度提升 10 倍、首个 token 生成速度提升 3 倍。8 月 17 日起所有新建和现有环境将默认启用构建。
推荐理由:官方原文给出启动速度倍数、构建频率和失败回退机制,读者可据此评估其对云端智能体工作流的影响。
Cursor 推出构建功能,在后台预先准备可直接使用的开发环境副本,智能体启动即可运行,无需额外费用。默认每小时创建一次新构建,环境损坏时智能体沿用上一次成功构建;Cursor 内部环境启动速度提升 10 倍、首个 token 生成速度提升 3 倍。8 月 17 日起所有新建和现有环境将默认启用构建。
推荐理由:官方原文给出启动速度倍数、构建频率和失败回退机制,读者可据此评估其对云端智能体工作流的影响。
Anthropic 发布 AI-native SDLC playbook,主张在代码不再瓶颈后重构传统软件开发生命周期,将流程改为以提交工件驱动的闭环。
推荐理由:Anthropic 把内部 agentic 编码实践整理成六阶段方法论,覆盖从需求捕获到自动回环的每一步落地与治理细节。
Anthropic 发文说明 Claude Opus 5.5 针对更长、上下文更重的编码会话做了成本优化,估计典型按 token 计费的工作负载运行成本比 Opus 5 低约 40%。
推荐理由:原文用 Claude Code 六个月聚合数据解释长上下文会话成本结构,并给出保护缓存读取的可操作建议。
Claude 推出插件目录提交门户,插件可打包 MCP 连接器、Agent Skills 或两者,经审核通过后上架 Claude 目录,成为第三方扩展的主要形式。
推荐理由:官方说明插件提交流程、审核与使用分析功能,开发者可据此了解如何为 Claude 构建第三方扩展。
NVIDIA 发布 Open Agent Safety Platform,Anthropic 与其合作,将 NVIDIA 开源软件 OpenShell 引入 Claude Managed Agents 的智能体安全体系。
推荐理由:Anthropic 官方说明与 NVIDIA OpenShell 的分层安全设计,读者可以据此评估企业智能体的权限控制方案。
Claude Code 推出 Artifacts,可基于会话完整上下文(代码库、连接器、对话)生成实时可共享的网页,如 PR 讲解、事故页、仪表盘和发布清单,页面随会话进展原地刷新,每次发布为新版本并支持历史回滚。
推荐理由:官方说明了 Artifacts 的构建方式、版本共享机制和权限策略,读者可以判断它能否替换团队现有的状态同步流程。
Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。
推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。
Cognition 基于两年多构建 Devin 的经验,指出容器化方案存在共享内核安全风险,也无法跨异步间隙保存状态,他们用 microVM 隔离和 hypervisor 级全机状态快照解决。
Cognition 发布 Devin CLI,可把 Devin 作为本地编码智能体在终端运行,通过 curl -fsSL https://cli.devin.ai/install.sh | bash 一分钟内安装。
推荐理由:发布方自述了本地会话与云端接力的具体玩法,读者可以据此评估是否把它接入自己的终端工作流。
Cognition 发布博客,总结过去一年在多家车企(包括 RV Tech 和 Mercedes)部署 Devin 处理 HIL/SIL 工作流的经验。
Cognition 推出 Auto-Triage,现已在 Devin Automations 中可用。Devin 可监控 Slack、Linear、GitHub、Sentry、Datadog 及 webhook 等来源的告警,自动检查代码库和可观测性工具、并行派出 sub-Devin 调查、关联重复事故、标注负责人,并在修复明确时直接开 PR。
Cognition 工程师分享 Devin 如何在云端虚拟机中自主验证自己的代码改动:Devin 通过截屏、点击、输入等 computer use 工具启动应用并点击测试,可 10 到 20 个并行运行。
Baseten 公布适用于 Dedicated Inference 和 Model APIs 的服务等级协议,承诺每月 System Availability 不低于 99.9%,按月度监控记录计算。未达标时客户可申请服务补偿,单月补偿上限为当月应付费用的 40%,且需自行发邮件申请。该 SLA 不适用于客户自托管部署的服务。
Baseten 正在招聘跨学科团队,构建其所谓的“推理云”(Inference Cloud),认为 AI 的未来是数百万个专用模型嵌入各类产品,而推理决定性能、可靠性、延迟与经济性。Abridge、Cursor、Lovable、Notion、OpenEvidence 等公司已依赖 Baseten 支撑生产环境的 AI 工作负载。
Baseten 面向 AI 初创公司推出 Startup Program,提供最高 25,000 美元 Dedicated Inference 或 Training 额度,以及最高 2,500 美元 Model APIs 额度。申请者须为 AI 为核心业务的种子轮到 A 轮公司、成立不满 5 年,且此前未获得过 Baseten 额度。入选者还可获得数小时响应支持、跨云自动扩缩容与 GTM 支持。
Baseten 为生产级 AI 推理提供全栈工程能力,覆盖模型开发、服务、编排、可观测性与底层优化,目标是在真实流量下兼顾吞吐、延迟与可靠性。其基础设施支持跨云跨区域 99.99% 可用性,并通过内核、量化、批处理、路由与硬件选型等逐层调优,按模型与流量定制配置而非套用通用预设。公司 2019 年由工程师创立,以前向部署工程师(FDE)与客户在真实流量下共同调优,从原型一路做到生产规模。
Cognition 宣布与美国能源部(DOE)签署谅解备忘录,加入被称为“美国 AI 曼哈顿计划”的 Genesis Mission,该计划于 2025 年 11 月由行政命令启动,目标是十年内让美国科研生产力翻倍。
Baseten 上线成本计算器,可在 Baseten Model APIs 上对比闭源 API 支出与开源模型的费用,并预估节省金额。估算基于输入与输出 token 用量及大致缓存命中率,结果仅为内部讨论用的一般性估算,Baseten 不保证实际节省金额。
Baseten 每周为 OpenEvidence 支撑数十亿次定制、微调 LLM 调用,向全美各大医疗机构提供高风险医疗信息。Baseten 称其可靠性与大规模深度支持已足以承担这一有时关乎生死的任务。此外,Baseten 与合作伙伴将说话人识别智能层直接前置到构建下一代 Voice AI 的开发者面前。
Baseten 推出面向医疗健康行业的 AI 推理基础设施,支持数字前台、健康聊天机器人和医疗记录员等场景。平台符合 SOC-2 Type II 与 HIPAA 合规要求,提供 99.99% 可用性和跨 10+ 云的统一 GPU 池,支持 Baseten Cloud、自托管或 Baseten Hybrid 部署,并按分钟计费、自动缩容至零。
Baseten 面向企业提供关键任务推理平台,支持在 Baseten Cloud 或自有云基础设施中部署,Baseten Cloud 提供单租户集群,自托管方案可在 VPC 故障时自动故障转移至 Baseten Cloud。
Baseten 上线 Embeddings 服务,可用任意嵌入模型快速处理数百万数据点,支持自定义 Docker 镜像、Truss 库和 Baseten Chains。该服务覆盖 BGE、Stella、SFR-Embedding、Nomic、NV-Embed、Voyage 等模型系列,面向语义搜索与推荐系统,提供五个 9 可用性、优化冷启动和弹性自动扩缩容,可缩容至零以节省成本。
Baseten 工程博客提出 Compound AI 系统,主张用多个专用模型组合替代庞大的全能单体模型,以获得更快、更便宜的推理。该系统让模型之间直接互相调用,减少网络开销、额外延迟和出网成本,并让每个步骤独立使用自动扩缩容的 GPU。文中列举的典型场景包括 AI 电话呼叫、AI 智能体和 RAG 流水线。
Baseten 提供面向大语言模型的推理基础设施,支持部署 DeepSeek V3 0324、DeepSeek R1 0528(均为 671B 参数 MoE 模型)、Llama 4 Scout(109B 总参数)和 Llama 4 Maverick(400B 总参数)等模型。
Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。
Baseten 推出前向部署工程师(forward deployed engineers)团队,以嵌入式工程方式帮客户架构系统、部署并优化模型。该团队提供跨云自动扩缩容与 99.99% 可用性保障,并针对不同模态应用推理栈优化,代码归客户所有。服务覆盖从 POC 到规模化的全过程,持续引入社区最新研究优化性能与成本。
Baseten 发布 Hybrid 混合部署方案,让模型推理在自有 VPC 内运行,并在流量高峰时无缝溢出到 Baseten Cloud。该方案支持多云端路由、区域锁定数据驻留与快速冷启动,可沿用现有云资源承诺以优化成本,并继承 Baseten Cloud 的 SOC 2 Type II、HIPAA 和 GDPR 合规能力。
Baseten 推出 Self-hosted 部署方案,让企业在自有 VPC 内获得与托管服务一致的毫秒级低延迟和高吞吐推理,模型输入输出不会经过 Baseten 服务器。该方案支持数据驻留与区域锁定部署,可满足 GDPR、HIPAA 等合规要求,并允许使用自有硬件或现有云厂商 credits 与 commits 优化成本。
Baseten 推出 Baseten Cloud,可在任意云厂商上运行生产级 AI 推理,提供毫秒级响应与 99.99% 可用性,无需人工干预即可自动扩缩容。该服务由 Baseten Inference Stack 驱动,支持区域锁定、单租户和自托管部署,且不存储模型输入与输出。
Baseten 为 20 多个云和区域构建了多云容量管理(MCM),支撑低延迟与 99.99% 可用性。MCM 通过 SLA 感知的自动扩缩容,把跨云 GPU 资源视为可互换,实现跨云动态路由与扩缩模型副本,以应对云故障和容量限制。该能力支持数据驻留与主权合规,可运行在 Baseten Cloud、自托管或混合模式中。
Baseten 发布面向推理优化的基础设施,支持多节点、多云、多区域部署,通过跨云自动扩缩容让模型在全球低延迟服务,并以跨云容量管理实现四个九可用性。其自动扩缩容器实时匹配流量与资源,冷启动优化可在数秒内拉起新副本,并提供自托管、云和混合三种部署方式。
Baseten 推出 Inference Runtime,将 TensorRT、SGLang、vLLM、TGI、TEI 等开源推理框架与自研优化整合进单一可配置运行时,宣称可在数分钟内完成配置。该运行时原生支持 Medusa、Eagle 等投机解码技术,并通过 KV cache 卸载与缓存感知路由、prefill 优先调度、TP 与 EP 混合并行等手段降低延迟。
Baseten 面向模型实验室推出 Frontier Gateway,可在数天内发布带认证、密钥管理、限流和用量计费的白标 API,由 Baseten Inference Stack 驱动。模型还可上架 Baseten Model Library 供开发者发现和调用,并享受 SOC 2、HIPAA、GDPR 合规及 99.99% 可用性 SLA。
Augment Code 介绍其基于 Cosmos 平台的 Incident Investigator Expert,在 Slack 中对每条 PagerDuty 告警自动执行分诊和根因分析,给出 RCA 和四种修复路径(监控、代码修复、回滚、升级),人工只需审核并批准。
Augment Code 推出 Project Builder,这是一个运行在 Cosmos 上的专家,可从简短功能描述生成基于真实代码库的设计文档(markdown 或 HTML 存入 Cosmos VFS),经人工评审后编排 worker agent 完成实施直至合并。
Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。
作者认为构建 agent 的团队应把路由设计放在第一位、模型选择放在最后。他提出三层结构:技能分类器识别任务意图、路由器根据复杂度等特征决定执行层级、模型选择器在层级内挑最便宜的合格模型。
AI 公司在 12 个月内投入 $9.75b 于前向部署工程(FDE),相当于 Accenture 年度人力成本的四分之一。
推荐理由:原文把 $9.75b FDE 投入拆成三种资本结构,并解释部署取代模型能力成为瓶颈后的护城河逻辑。
Tomer Tunguz 介绍其正在实验的智能体记忆架构:查询先经 preflight 从约 90 个技能文件中按意图检索相关技能载入上下文窗口,再由本地 Ornith 35B(经 Ollama 运行于 Apple Silicon)执行,约 80% 的常规任务留在本地,困难任务路由到 frontier 模型。
Claude 现已在 Microsoft Foundry 正式可用,企业可用现有 Azure 认证、计费与治理体系构建生产应用和企业智能体,用量计入 Azure 账单,符合条件的支出可计入 MACC。
推荐理由:原文说明 Claude 在 Microsoft Foundry 正式可用后的计费、合规与部署方式,读者可据此评估接入 Azure 工作流的可行性。