Baseten 面向医疗健康行业推出合规 AI 推理基础设施
Baseten 推出面向医疗健康行业的 AI 推理基础设施,支持数字前台、健康聊天机器人和医疗记录员等场景。平台符合 SOC-2 Type II 与 HIPAA 合规要求,提供 99.99% 可用性和跨 10+ 云的统一 GPU 池,支持 Baseten Cloud、自托管或 Baseten Hybrid 部署,并按分钟计费、自动缩容至零。
Baseten 推出面向医疗健康行业的 AI 推理基础设施,支持数字前台、健康聊天机器人和医疗记录员等场景。平台符合 SOC-2 Type II 与 HIPAA 合规要求,提供 99.99% 可用性和跨 10+ 云的统一 GPU 池,支持 Baseten Cloud、自托管或 Baseten Hybrid 部署,并按分钟计费、自动缩容至零。
Baseten 面向企业提供关键任务推理平台,支持在 Baseten Cloud 或自有云基础设施中部署,Baseten Cloud 提供单租户集群,自托管方案可在 VPC 故障时自动故障转移至 Baseten Cloud。
Baseten 上线 Embeddings 服务,可用任意嵌入模型快速处理数百万数据点,支持自定义 Docker 镜像、Truss 库和 Baseten Chains。该服务覆盖 BGE、Stella、SFR-Embedding、Nomic、NV-Embed、Voyage 等模型系列,面向语义搜索与推荐系统,提供五个 9 可用性、优化冷启动和弹性自动扩缩容,可缩容至零以节省成本。
Baseten 工程博客提出 Compound AI 系统,主张用多个专用模型组合替代庞大的全能单体模型,以获得更快、更便宜的推理。该系统让模型之间直接互相调用,减少网络开销、额外延迟和出网成本,并让每个步骤独立使用自动扩缩容的 GPU。文中列举的典型场景包括 AI 电话呼叫、AI 智能体和 RAG 流水线。
Baseten 提供面向大语言模型的推理基础设施,支持部署 DeepSeek V3 0324、DeepSeek R1 0528(均为 671B 参数 MoE 模型)、Llama 4 Scout(109B 总参数)和 Llama 4 Maverick(400B 总参数)等模型。
Baseten 推出文本转语音(Text-to-speech)服务,可部署 Orpheus TTS、CAMB.AI 的 MARS6 以及 Qwen3 TTS 12Hz 等语音合成模型。
Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。
Baseten 发布基于 OpenAI Whisper 优化的转录与说话人分离方案,Whisper V3 Turbo 在 H100 MIG 上实现超 2400x RTF,Whisper Large V3 达 1800x RTF(1 小时音频约 2 秒转完)。
Baseten 推出前向部署工程师(forward deployed engineers)团队,以嵌入式工程方式帮客户架构系统、部署并优化模型。该团队提供跨云自动扩缩容与 99.99% 可用性保障,并针对不同模态应用推理栈优化,代码归客户所有。服务覆盖从 POC 到规模化的全过程,持续引入社区最新研究优化性能与成本。
Baseten 发布 Hybrid 混合部署方案,让模型推理在自有 VPC 内运行,并在流量高峰时无缝溢出到 Baseten Cloud。该方案支持多云端路由、区域锁定数据驻留与快速冷启动,可沿用现有云资源承诺以优化成本,并继承 Baseten Cloud 的 SOC 2 Type II、HIPAA 和 GDPR 合规能力。
Baseten 推出 Self-hosted 部署方案,让企业在自有 VPC 内获得与托管服务一致的毫秒级低延迟和高吞吐推理,模型输入输出不会经过 Baseten 服务器。该方案支持数据驻留与区域锁定部署,可满足 GDPR、HIPAA 等合规要求,并允许使用自有硬件或现有云厂商 credits 与 commits 优化成本。
Baseten 推出 Baseten Cloud,可在任意云厂商上运行生产级 AI 推理,提供毫秒级响应与 99.99% 可用性,无需人工干预即可自动扩缩容。该服务由 Baseten Inference Stack 驱动,支持区域锁定、单租户和自托管部署,且不存储模型输入与输出。
Baseten 为 20 多个云和区域构建了多云容量管理(MCM),支撑低延迟与 99.99% 可用性。MCM 通过 SLA 感知的自动扩缩容,把跨云 GPU 资源视为可互换,实现跨云动态路由与扩缩模型副本,以应对云故障和容量限制。该能力支持数据驻留与主权合规,可运行在 Baseten Cloud、自托管或混合模式中。
Baseten 发布面向推理优化的基础设施,支持多节点、多云、多区域部署,通过跨云自动扩缩容让模型在全球低延迟服务,并以跨云容量管理实现四个九可用性。其自动扩缩容器实时匹配流量与资源,冷启动优化可在数秒内拉起新副本,并提供自托管、云和混合三种部署方式。
Baseten 推出 Inference Runtime,将 TensorRT、SGLang、vLLM、TGI、TEI 等开源推理框架与自研优化整合进单一可配置运行时,宣称可在数分钟内完成配置。该运行时原生支持 Medusa、Eagle 等投机解码技术,并通过 KV cache 卸载与缓存感知路由、prefill 优先调度、TP 与 EP 混合并行等手段降低延迟。
Baseten 面向模型实验室推出 Frontier Gateway,可在数天内发布带认证、密钥管理、限流和用量计费的白标 API,由 Baseten Inference Stack 驱动。模型还可上架 Baseten Model Library 供开发者发现和调用,并享受 SOC 2、HIPAA、GDPR 合规及 99.99% 可用性 SLA。
Augment Code 提出 AI 原生转型分四个阶段:约 70% 组织仍停留在第一阶段(将智能体接入日常工作流),不到 10% 让智能体自主拥有工作,几乎无人达到第四阶段全智能体编排。在软件开发生命周期六个环节中,代码生成、验证、构建失败诊断三个环节已由智能体主导,代码审查中低风险改动可自动批准。某企业客户开发者每周因代码审查阻塞的时间占比从 30% 降至 10% 以下。
Augment Code 本月在 Claude 和 GPT-5 之外新增 Gemini 3.1 Pro,成为其第三个可选模型,并称单模型工程时代已经结束。过去十三个月里领先模型三次易主,GPT-5.4 的每条消息价格比此前所用模型便宜约 2.6 倍。其做法是把模型、harness(Context Engine)与编排层(Intent)解耦,切换模型只需改一个设置而非迁移。
Augment Code 用内部评测 AuggieBench 测量数十个 AGENTS.md 对代码生成的影响,最好的文件带来相当于从 Haiku 升级到 Opus 的质量提升,最差的比没有文件更糟。
推荐理由:作者基于内部评测给出了 AGENTS.md 的可用与失效模式,读者可以按自身模块选择对应写法。
DX CTO Justin Reock 在 We Built What 节目中称 AI 转型的关键在系统而非个人:DX 对 500 家公司的纵向研究显示 PR velocity 中位提升 7.5%、均值 13%、最高 70%。
Augment Code 在 OpenClaw 的 40 个 PR 上测试 Auggie、Claude Code 和 Codex,对比在 AGENTS.md 前加入约 2.5k 字符的 Karpathy 式编码规则的效果。
推荐理由:原文用三个 Agent 和 40 个 PR 的实测数据,说明 Karpathy 式规则能降本提速但质量不升,可迁移到自家工作流。
Augment Code 推出 Prism,一种模型路由选项,为每轮用户请求自动选择底层模型,称团队月发 1 万次请求可省约 2 万美元,成本最多降 30%,质量与所对标的前沿推理模型差异可忽略。
推荐理由:官方给出多基准成本与质量数据及缓存感知路由方法,读者可据此评估模型路由能否降低自己的智能体开销。
Augment 在 Cosmos 上重建代码审查流程,由 PR Risk Analyzer、Bug Reviewer、Pair Reviewer 等 Expert 组成智能体团队,自动批准低风险改动、逐行做正确性分析,仅在需要判断时引入人类。
Augment Code 调研 219 位工程负责人发现,其团队 48% 的代码已由 AI 生成,55% 担心团队失去对代码库的共同理解,63% 表示工程师向管理者提出技能相关性担忧,在 201-1000 人团队中该比例升至 89%。
Augment 在 Terminal Bench 2.0 上用 Opus 4.7 对比 Auggie CLI 与 Claude Code,Auggie 通过率 67.4% 对 66.3%,总 token 少 32%、成本低 33%($463.04 对 $694.50)。
Augment Code 介绍其基于 Cosmos 平台的 Incident Investigator Expert,在 Slack 中对每条 PagerDuty 告警自动执行分诊和根因分析,给出 RCA 和四种修复路径(监控、代码修复、回滚、升级),人工只需审核并批准。
Augment Code 的 Cosmos 平台让智能体串联代码审查与事故响应等环节,大型 PR 的人工审查时间从六七小时降到 45 分钟,周产出提升至三倍。事故响应中智能体已处理 81.3% 的告警,值班工程师每周合并的 PR 增加 44%,首次 RCA 时间从约 30 分钟降至 6 分钟。人类仍负责设计判断、风险把控与最终决策。
OpenBMB 发布 2.6B 参数稠密推理模型 MiniCPM5-2B,以 Apache 2.0 协议开放权重,在 Artificial Analysis Intelligence Index v4.2 得分 15,为 4B 以下总参数开源权重模型最高。
Augment Code 推出 Project Builder,这是一个运行在 Cosmos 上的专家,可从简短功能描述生成基于真实代码库的设计文档(markdown 或 HTML 存入 Cosmos VFS),经人工评审后编排 worker agent 完成实施直至合并。
Artificial Analysis 发布 Intelligence Index v4.3,用 Terminal-Bench 4.0 和 AutomationBench-AA 替换旧评测项,私密测试集权重从 v4.2 的 40% 升至 45%。
Augment Code 构建了名为 Mimi 的 AI 数据分析师,接入 Linear、Slack 和 GitHub,并从 Hex 认证报告与 dbt 模型(Mimir 仓库)取数回答团队提问。
Artificial Analysis 发布 GPT-6 Astra 基准测试报告,该模型在 Intelligence Index 得 53 分、Coding Agent Index 得 62 分,均与 Claude Fable 5.1 并列第一,且成本分别约为其 40% 和 60%。
推荐理由:原文给出 GPT-6 Astra 在两大指数中的得分、成本和 token 效率数据,可据此比较它与 Claude Fable 5.1 的实际表现。
Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。
Artificial Analysis 更新 Capability Indices 至 v1.1,结合 Intelligence Index v4.2 与 v4.3 的领域切片及专项评测,按 O*NET 职业任务映射基准并加权。
Augment Code 博客提出 loop engineering 概念,即设计从触发、执行、验证到产出的智能体循环,人类在需要判断力的检查点介入。
ARC Prize 发布上线 24 小时的首日更新:社媒累计浏览 67.5 万,登顶 Kaggle 竞赛榜,已有 700 名 Kaggle 参赛者、70 次提交,当前最高分 18%。
ARC Prize 通讯宣布 Jack Cole、Mohammed Osman 和 Michael Hodel 在 ARC-AGI 私有评测集上创下 39% 的首个新纪录。
ARC Prize 官方推出 ARC-AGI-Pub 公开排行榜,使用公开评测集,取消算力限制、允许联网,并提供 15 万美元验证基金,对复现并验证的高分提交报销最高 $2,500 API 费用。
ARC Prize 社区通讯披露,Aditya Advani 团队凭 ARC-AGI-Pub 项目在旧金山 AGI House 黑客松拿下第三名。ARC-AGI-Pub 排行榜已上线,官方为其设立 15 万美元验证基金,该榜不计入 ARC Prize 2024 且无奖金。Kaggle 参赛者增至 6,539 人、434 支队伍,每日提交上限从 5 次降至 3 次以抑制过拟合。
ARC Prize 社区通讯宣布 Team MindsAI(Jack Cole、Michael Hodel、Mohammed Osman)以 41% 的新 SOTA 成绩首次突破 ARC-AGI 40% 大关。