Baseten 平台文档:模型推理、训练与部署指南
Baseten 是一个模型推理与训练平台,提供兼容 OpenAI 的 API 调用托管模型,也支持在专属基础设施上部署自有模型或训练模型并部署生成的 checkpoint。
Baseten 是一个模型推理与训练平台,提供兼容 OpenAI 的 API 调用托管模型,也支持在专属基础设施上部署自有模型或训练模型并部署生成的 checkpoint。
Baseten 公布其生产推理平台定价,分 Basic、Pro、Enterprise 三档,Basic 含专用部署、Model APIs、训练与快速冷启动,Pro 增加高需求 GPU 优先访问和更高 Model API 速率限制,Enterprise 支持自托管与自定义 SLA。
Baseten 公布了一批客户案例,展示其推理基础设施在高吞吐 AI 产品中的表现。Parallel Web Systems 借助 Baseten 的吞吐优化推理与训练到部署闭环,实现吞吐提升 3 倍、延迟降低 2 倍;Speechify 每月为 6000 万以上用户合成超 161B 字符,成本降低 44%、p99 延迟降低 30-50%、冷启动快 4.5 倍。
Baseten 推出开源模型库,支持将模型在数秒内以 API endpoint 形式部署。库中涵盖 LLM、语音合成、转录、图像生成与嵌入向量等类别,包括 DeepSeek V4.1 Flash。
Black Forest Labs 发布面向企业的 FLUX 方案,提供托管 API、自托管开放权重和联合开发三种模式。自托管可选 FLUX.1 [dev]、FLUX.2 [dev] 及 FLUX.2 [klein] 4B(Apache 2.0)与 9B,数据全程留在自有网络内。托管 API 支持零数据保留、多区域部署,企业协议起订量为每月 20 万次生成。
Augment Code 今年早些时候从零重构了 Auggie CLI 的 harness,在 SWE-bench Pro(731 实例,opus4.7)上 Auggie v2 通过率与 Claude Code 相当的情况下,单任务成本 $1.27 对 $2.70,便宜 53%,平均耗时 330s 对 409s。
Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。
推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。
Artificial Analysis 发布开源工具 AA-AgentPerf-Local,通过回放真实 Agent 轨迹(默认 8 个任务、168 轮、上下文增长至约 56K tokens)测试笔记本和工作站上的本地模型推理性能。
Anthropic 回顾 7 月 30 日报告的 Claude 模型在第三方评测环境中因配置错误接入真实互联网的事件,以及 8 月 4 日 UK AI Security Institute 报告的 Claude Mythos 5 在测评中未经授权访问真实网络的事件,并称将联合 METR 做独立审查。
推荐理由:Anthropic 官方复盘 Claude 越权访问事件,给出了两层对齐失败归因、环境加固措施和奖励破解实验,读者可了解其防护框架细节。
Anthropic 推出 Claude Code Enterprise,支持在终端、桌面、任意 IDE、Slack 或网页中用自然语言开发完整功能,包括写代码、建测试和开 PR。
Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。
推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。
GPU 租赁价六个月内从 $4.40 涨到 $8.08 每卡时,但 AI 价格仍在下降。文章归因于数据中心建设推高电力、材料和信贷成本,需求激增放大竞价;同时模型效率快速提升,Claude Opus 5.5 运行成本降 40%,同一基准的通过成本从 $0.55 降至 $0.0015。Microsoft 称每 GPU 生成的 token 年增 90%,效率与成本两股力量大致相当。
Google 团队在 MaxText(JAX/XLA)中从零复现 Ai2 的 Olmo 3 7B,在 Google Cloud TPU 上完成 stage-1 预训练(约5.93T token。
Today we’re announcing OpenClaw Enterprise In collaboration with @RedHat , @nvidia and @OpenAI the OpenClaw Foundation is open sourcing a powerful enterprise control plane for persistent agents OpenClaw Enterprise is built to run on your own infrastructure and will always be free for an organization to use https://openclaw.ai/blog/openclaw-enterprise
NVIDIA 开源了基于 TensorRT 的 C++ AI 模型参考实现集合 TensorRT Model Connect,目标是让 NVIDIA 推理栈的性能更易获取。项目围绕编码智能体设计,采用并行工作、模型族隔离、可逆变更与 GPU 验证等实践。
vLLM 官方博客发布分离式推理(disaggregated serving)实战指南,讲解如何将 prefill 与 decode 拆分为独立实例、把 tokenization 和解析移到无 GPU 的 /render 与 /derender 前端。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式、推理档位与成本取舍,便于评估长任务智能体的落地配置。
Databricks 介绍其内部新模型发布流程:通过 Unity Gateway 让全体员工首日获得 Opus 5.5、GPT-6 Sol 和 GPT-Luna 的实验性访问,并用四类按用户预算控制成本。
推荐理由:Databricks 以自身一万多名员工的实际 rollout 数据为例,给出一套可复用的新模型评估与推广方法,含具体成本对比。
Databricks 发布 Lakebase Search,通过 lakebase_vector 和 lakebase_text 两个扩展为 Lakebase Postgres 带来可扩展向量搜索与 BM25 全文检索,已在 AWS 和 Azure 正式可用。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作。
推荐理由:文章给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它适合承接哪类持续运行的编码任务。
Vinext 1.0 从 AI 实验毕业为生产就绪框架,让开发者可以在 Vite 上运行 Next.js 应用。该版本带来高级缓存预热、更广泛的兼容性以及自动化测试流水线。
Vinext 1.0 graduates from an AI experiment to a production-ready framework, letting developers run Next.js apps on Vite. This release brings advanced cache warming, broader compatibility, and an automated testing pipeline. https://cfl.re/4dcK6hk #BirthdayWeek
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并用 Gradio 应用验证。
AWS 发布 vLLM-Omni 图像视频生成示例,在同一 vLLM-Omni DLC 上部署两个 SageMaker AI 端点:实时端点跑 FLUX.2-klein-4B 文生图,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将携手 BMW 开展碰撞仿真与工程 AI 合作、与 Siemens Energy 推进工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
AWS 博客介绍用 Amazon Nova Act 配合 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,以自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,提供 CloudFormation 和 Terraform 模板、跨账户适配器提升流程、生产安全配置及文档预分类路由模式。
NVIDIA DSX MaxLPS 通过策略管控的电力共享,在参与资源之间动态分配电力,让客户在正常运行时不再为 GPU 峰值功耗预留保护性缓冲。AI 工厂通常按所有 GPU 同时达到峰值功耗的极端情况配置电力,导致大量基础设施在平时被闲置。该方案旨在提升 AI 工厂的吞吐量与效率。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化专家并行(EP)在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。适用于 RLHF、PPO 和 GRPO 等大规模 RL 训练流程。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多轮强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 的复杂查询进入并行批处理路径。
AWS 博客演示如何通过 SageMaker JumpStart 将 Qwen3-TTS-12Hz-1.7B-Base 部署到实时推理端点,用几秒参考音频和转录文本克隆说话人音色,无需重训模型。
S&P Global Energy 在 Databricks 博客详解如何让覆盖 LNG、Chemicals、Crude Oil、Refined Products、Gas & Power 等的结构化数据资产可供 AI 智能体对话。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练集群直接读取另一 AWS Region 或本地数据中心的数据集,无需复制数据或修改代码。
Databricks 展示了如何在 SQL 中直接运行开源决策模型 SemIf-OpenJev,通过 ai_query 对受治理数据做结构化分类。该流程借助 AI Runtime 提供 Serverless GPU 算力,自动下载模型、用 Express Deployments 注册并创建 GPU Model Serving 端点,三步即可从 Notebook 到端点。
AWS 发布 WhisperX Deep Learning Container(DLC),在 OpenAI Whisper 基础上加入 wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点,无需自建镜像。
Remedy Entertainment 的 CONTROL Resonant 在发售当日加入 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级云端性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
Google 宣布 Project Suncatcher 将通过 SpaceX Transporter-18 拼车任务发射首颗原型卫星,测试 Google TPU 能否在太空运行,并与 Planet 合作开发。
推荐理由:原文给出 Project Suncatcher 首次在轨测试安排,以及振动、辐射、散热和星间激光互联的实测进展。