Cognition:Fusion 架构下 Fable 5 领衔的 Devin 反而比 Opus 4.8 更省钱且得分更高
Cognition 在 FrontierCode 1.1 上跑了 3000 次评测,发现尽管 Fable 5 每 token 价格是 Opus 4.8 的 2 倍,配合 Sidekick 时反而更便宜且得分更高(60.7 vs 54.6,$1.86 vs $2.04),比纯 Fable 省 54% 成本。
Cognition 在 FrontierCode 1.1 上跑了 3000 次评测,发现尽管 Fable 5 每 token 价格是 Opus 4.8 的 2 倍,配合 Sidekick 时反而更便宜且得分更高(60.7 vs 54.6,$1.86 vs $2.04),比纯 Fable 省 54% 成本。
Baseten 上线成本计算器,可在 Baseten Model APIs 上对比闭源 API 支出与开源模型的费用,并预估节省金额。估算基于输入与输出 token 用量及大致缓存命中率,结果仅为内部讨论用的一般性估算,Baseten 不保证实际节省金额。
Cohere 推出 Embed 5 系列前沿嵌入模型,是其迄今最强的嵌入模型,现已提供 Pro 和 Fast 两个档位。同期 Cohere 还发布 North Small Translate 开源权重机器翻译模型,并提出衡量企业检索质量的 RCP-nDCG@10 新指标。
Baseten 宣布自 10 月 1 日 15:00 UTC 起新建 API key 将加 b10_ 前缀,便于在代码、日志和密钥扫描器中识别。Hosted Tools 通过 Baseten Grounded Inference 为 Model APIs 引入服务端联网搜索,可经 Exa、Keenable、Parallel 或 You.com 检索并抓取实时网页内容。
Baseten 推出面向医疗健康行业的 AI 推理基础设施,支持数字前台、健康聊天机器人和医疗记录员等场景。平台符合 SOC-2 Type II 与 HIPAA 合规要求,提供 99.99% 可用性和跨 10+ 云的统一 GPU 池,支持 Baseten Cloud、自托管或 Baseten Hybrid 部署,并按分钟计费、自动缩容至零。
Trail of Bits 开源 Trailmark,一个将源码解析为可查询调用图(函数、类、调用关系与语义元数据)的库,支持 17 种语言,通过 Python API 供 Claude 技能直接调用,并同步发布 8 个 Claude Code 技能用于突变分诊、测试向量生成、协议图等。
Baseten 面向企业提供关键任务推理平台,支持在 Baseten Cloud 或自有云基础设施中部署,Baseten Cloud 提供单租户集群,自托管方案可在 VPC 故障时自动故障转移至 Baseten Cloud。
Baseten 上线 Embeddings 服务,可用任意嵌入模型快速处理数百万数据点,支持自定义 Docker 镜像、Truss 库和 Baseten Chains。该服务覆盖 BGE、Stella、SFR-Embedding、Nomic、NV-Embed、Voyage 等模型系列,面向语义搜索与推荐系统,提供五个 9 可用性、优化冷启动和弹性自动扩缩容,可缩容至零以节省成本。
Trail of Bits 发布 gosentry,一个面向 fuzzing 的 Go 工具链 fork,让 go test -fuzz 默认使用 LibAFL,同时保留 testing.F 工作流和现有 harness API。
Baseten 提供面向大语言模型的推理基础设施,支持部署 DeepSeek V3 0324、DeepSeek R1 0528(均为 671B 参数 MoE 模型)、Llama 4 Scout(109B 总参数)和 Llama 4 Maverick(400B 总参数)等模型。
Baseten 推出文本转语音(Text-to-speech)服务,可部署 Orpheus TTS、CAMB.AI 的 MARS6 以及 Qwen3 TTS 12Hz 等语音合成模型。
Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。
Baseten 发布基于 OpenAI Whisper 优化的转录与说话人分离方案,Whisper V3 Turbo 在 H100 MIG 上实现超 2400x RTF,Whisper Large V3 达 1800x RTF(1 小时音频约 2 秒转完)。
Baseten 推出前向部署工程师(forward deployed engineers)团队,以嵌入式工程方式帮客户架构系统、部署并优化模型。该团队提供跨云自动扩缩容与 99.99% 可用性保障,并针对不同模态应用推理栈优化,代码归客户所有。服务覆盖从 POC 到规模化的全过程,持续引入社区最新研究优化性能与成本。
Baseten 发布 Hybrid 混合部署方案,让模型推理在自有 VPC 内运行,并在流量高峰时无缝溢出到 Baseten Cloud。该方案支持多云端路由、区域锁定数据驻留与快速冷启动,可沿用现有云资源承诺以优化成本,并继承 Baseten Cloud 的 SOC 2 Type II、HIPAA 和 GDPR 合规能力。
Baseten 推出 Self-hosted 部署方案,让企业在自有 VPC 内获得与托管服务一致的毫秒级低延迟和高吞吐推理,模型输入输出不会经过 Baseten 服务器。该方案支持数据驻留与区域锁定部署,可满足 GDPR、HIPAA 等合规要求,并允许使用自有硬件或现有云厂商 credits 与 commits 优化成本。
Baseten 推出 Baseten Cloud,可在任意云厂商上运行生产级 AI 推理,提供毫秒级响应与 99.99% 可用性,无需人工干预即可自动扩缩容。该服务由 Baseten Inference Stack 驱动,支持区域锁定、单租户和自托管部署,且不存储模型输入与输出。
Baseten 为 20 多个云和区域构建了多云容量管理(MCM),支撑低延迟与 99.99% 可用性。MCM 通过 SLA 感知的自动扩缩容,把跨云 GPU 资源视为可互换,实现跨云动态路由与扩缩模型副本,以应对云故障和容量限制。该能力支持数据驻留与主权合规,可运行在 Baseten Cloud、自托管或混合模式中。
Baseten 发布面向推理优化的基础设施,支持多节点、多云、多区域部署,通过跨云自动扩缩容让模型在全球低延迟服务,并以跨云容量管理实现四个九可用性。其自动扩缩容器实时匹配流量与资源,冷启动优化可在数秒内拉起新副本,并提供自托管、云和混合三种部署方式。
Baseten 推出 Inference Runtime,将 TensorRT、SGLang、vLLM、TGI、TEI 等开源推理框架与自研优化整合进单一可配置运行时,宣称可在数分钟内完成配置。该运行时原生支持 Medusa、Eagle 等投机解码技术,并通过 KV cache 卸载与缓存感知路由、prefill 优先调度、TP 与 EP 混合并行等手段降低延迟。
Augment Code 推出 Prism,一种模型路由选项,为每轮用户请求自动选择底层模型,称团队月发 1 万次请求可省约 2 万美元,成本最多降 30%,质量与所对标的前沿推理模型差异可忽略。
推荐理由:官方给出多基准成本与质量数据及缓存感知路由方法,读者可据此评估模型路由能否降低自己的智能体开销。
Augment 在 Cosmos 上重建代码审查流程,由 PR Risk Analyzer、Bug Reviewer、Pair Reviewer 等 Expert 组成智能体团队,自动批准低风险改动、逐行做正确性分析,仅在需要判断时引入人类。
Augment 在 Terminal Bench 2.0 上用 Opus 4.7 对比 Auggie CLI 与 Claude Code,Auggie 通过率 67.4% 对 66.3%,总 token 少 32%、成本低 33%($463.04 对 $694.50)。
Augment Code 的 Cosmos 平台让智能体串联代码审查与事故响应等环节,大型 PR 的人工审查时间从六七小时降到 45 分钟,周产出提升至三倍。事故响应中智能体已处理 81.3% 的告警,值班工程师每周合并的 PR 增加 44%,首次 RCA 时间从约 30 分钟降至 6 分钟。人类仍负责设计判断、风险把控与最终决策。
Augment Code 推出 Project Builder,这是一个运行在 Cosmos 上的专家,可从简短功能描述生成基于真实代码库的设计文档(markdown 或 HTML 存入 Cosmos VFS),经人工评审后编排 worker agent 完成实施直至合并。
Augment Code 构建了名为 Mimi 的 AI 数据分析师,接入 Linear、Slack 和 GitHub,并从 Hex 认证报告与 dbt 模型(Mimir 仓库)取数回答团队提问。
Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。
ARC Prize 上线 Daily Puzzle,每天 UTC 12 点从 ARC-AGI 任务中选出一道作为当日谜题,Play 页面成为其主页,点击 Start 后开始计时并统计尝试次数。该功能无奖金,结果可分享至 X/Twitter、Discord 等平台,官方称这是 v1,后续将根据反馈加入教程等功能。
Black Forest Labs 发布 FLUX VTO 虚拟试穿模型,现已公开可用,并加入 FLUX MCP。单次生成低于 4 秒,可自托管实现亚秒级响应,最多可给同一模特叠加 4 件服装,并保留人物身份与服装的 logo、印花、缝线和配件细节。默认审核政策下不支持泳装和内衣,官方提示精确的身材与服装尺码功能仍在演进,输出适合作为视觉搭配参考。
Black Forest Labs 宣布 FLUX.2 [klein] 4B 将预装在 ASUS 下一代 ProArt RTX 笔记本的 MuseTree 应用中,该产品线在台北 Computex 2026 上亮相。
Anthropic 为 Claude 推出插件市场,收录 340 个插件,可将工具、技能与集成打包为一键安装。
推荐理由:原文列出了插件市场的实际内容和安装方式,读者可以据此挑选适合自己的 Claude 扩展组合。
Anthropic 为 Claude 上线 Connectors 连接器目录,共收录 872 个连接器,把用户已有的工具接入每一段 Claude 对话。目录中包含 Microsoft 的 Playwright MCP server,可让 Claude 操作网页、截图、填表和自动化测试,以及 Upstash 的 Context7 MCP server,用于拉取版本相关的文档与代码示例。
Anthropic 博客汇总了近期 Claude 产品更新:Claude Cowork 与聊天已合并为统一的 Claude,Claude in Chrome 正式可用,Claude Code 支持 artifacts,Claude Marketplace 上线以集中发现合作伙伴的插件、智能体与服务。
Anthropic 上线 Claude 平台控制台登录页,供开发者基于前沿 Claude 模型和托管智能体基础设施构建智能体与应用。页面提示继续操作即表示同意 Anthropic 商业条款、使用政策并确认隐私政策,面向使用 Claude API 的公司。
Claude 现已在 Microsoft Foundry 正式可用,企业可用现有 Azure 认证、计费与治理体系构建生产应用和企业智能体,用量计入 Azure 账单,符合条件的支出可计入 MACC。
推荐理由:原文说明 Claude 在 Microsoft Foundry 正式可用后的计费、合规与部署方式,读者可据此评估接入 Azure 工作流的可行性。
Anthropic 推出 Claude on AWS,让团队在 AWS 环境中使用 Claude 构建智能体并向客户交付 AI 产品。该方案提供 Claude API 与原生 Claude 体验,支持 AWS 原生认证、IAM 与审计集成,并通过 AWS 统一账单计费、计入 AWS 承诺消费。
Anthropic 为 Claude 推出区域数据驻留与推理驻留能力,用户可指定提示词、输出和对话历史的存储地及模型处理地,覆盖亚太、加拿大、欧洲和美国(美国即将上线),可通过 AWS Bedrock、GCP Vertex 和 Microsoft Foundry 部署。
Anthropic 上线 Claude Marketplace,汇集 15 款 Claude 驱动的合作伙伴产品,包括 Cursor、GitLab、Snowflake、Vercel、CodeRabbit、Lovable 等。企业可将现有 Anthropic 采购承诺用于这些工具,统一 AI 支出,并随需求增加合作伙伴。
Anthropic 推出 Claude Marketplace 生态系统,提供超过 2000 个连接器和插件,可连接 Google Drive、Gmail、Microsoft 365、Notion、Slack、Atlassian 等应用。
推荐理由:Anthropic 官方页面列出了生态的实际组成和开放入口,读者可以据此了解 Claude 周边的连接器、产品和合作资源。
Anthropic Claude Platform 开发者文档介绍接入 Claude 的两种方式:Messages 供开发者直接访问模型并自行编写工具循环,Managed Agents 提供带持久事件历史的有状态会话以部署托管智能体。