vLLM 中 Kimi K3 性能优化:吞吐量提升至 2.8 倍
vLLM 通过自适应投机 token 预算、KDA 前缀检查点、零拷贝混合 KDA 批次和延迟 MXFP4 收尾等优化,将 Kimi K3 服务性能从 v0.27.1 提升至 main:延迟降低 56%–60%,吞吐量提升 2.2–2.8 倍,TTFT 降低 72%–85%(并发 1、4、16,8K/1K 负载,TP8)。
vLLM 通过自适应投机 token 预算、KDA 前缀检查点、零拷贝混合 KDA 批次和延迟 MXFP4 收尾等优化,将 Kimi K3 服务性能从 v0.27.1 提升至 main:延迟降低 56%–60%,吞吐量提升 2.2–2.8 倍,TTFT 降低 72%–85%(并发 1、4、16,8K/1K 负载,TP8)。
SemiAnalysis 分析 Nvidia 2Q F1/27 10-Q 披露的 5300 亿美元表外担保,较上季度 1840 亿美元大幅跳升,远超其 910 亿美元表内负债。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于满足 ChatGPT 在线存储的规模化需求。
NVIDIA 通过全栈 NIM 优化,在 Nemotron 3 Ultra 上实现 2.5 倍并发用户量。该优化针对生产环境部署大语言模型时,在现有 GPU 基础设施上提升并发服务能力并保持交互响应速度的需求,对提示词长、上下文跨步骤复用的智能体 AI 工作负载尤为关键。
NVIDIA BioNeMo Inference Runtime(BioIR)可在 NVIDIA GPU 上加速受支持的生物分子结构预测模型,同时保留熟悉的 PyTorch 工作流。它通过优化 kernel 并在适用场景下使用 CUDA Graphs 提升模型速度,面向蛋白质组规模的高通量结构预测任务。
SemiAnalysis 报告称其能源模型已追踪到 75GW 表后 AI 算力的确定性订单,仅 2026 年 Q2 就新增约 20GW,微软年内签署超 5GW,OpenAI 将在得州 Shackelford County 启用 1.4GW 离网园区。
推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境内用专有数据训练自有模型,所有权归企业所有。Cloudera 平台承载 30 exabytes 客户管理数据,双方瞄准金融、制造、电信等受监管行业的主权 AI 需求。
NVIDIA 正用 Nemotron 与 Palantir Foundry 把供应链经验编码化,其供应链绩效以"wafer-out 到 first token"衡量,分为 time-to-rack 与 time-to-token 两段。time-to-rack 覆盖硅片离开晶圆厂到组装系统抵达数据中心;time-to-token 则涵盖供电、冷却、网络与软件栈。
Together AI 的 kernels 团队为 NVIDIA Vera Rubin NVL72 平台在 ThunderKittens 中新增了 NVFP4 与 FP8 GEMM 支持。
Together AI 宣布 Together GPU Clusters 推出 preemptible compute 公开预览,覆盖所有区域的 Kubernetes 集群。
vLLM 官方博客介绍其分层 KV cache 卸载框架,自 v0.22 起可用,将逐出的 KV 数据保存到主机内存、文件系统、对象存储或远程节点,避免重新计算。
Hugging Face 博客介绍 TRL v1.14 的 AsyncGRPOTrainer 新支持:只训练 LoRA 适配器并仅同步适配器(rank-1 仅几 MB)到 vLLM,训练器与 vLLM 副本作为独立 HF Jobs 运行在分开的机器上,通过挂载 Storage Bucket 共享适配器路径,无需 NCCL 或共享本地盘。
MiniMax M3 在 AMD Instinct MI355X 上的 vLLM 服务性能大幅提升:SemiAnalysis InferenceX 基准显示,并发 32 时 MXFP8 标准服务从 109.1 升至 342.4 output tokens/s/GPU(3.14×),中位 TTFT 从 1.46 秒降至 0.67 秒。
NVIDIA 技术博客解析了 Encode-Prefill-Decode(EPD)分离架构这一多模态模型推理优化技术,它将视觉编码器阶段与 prefill、decode 阶段分离。该方案对图像密集提示词、中短输出和量化 MoE 模型最有效,配合 NVIDIA Dynamo 可实现最高 5 倍加速。
NVIDIA 发布 CUDA Toolkit 13.4,新增对 Windows on Arm 平台的支持,此前 CUDA 应用在 Arm 平台仅通过 Linux 获得支持。该版本还增强了对共享 GPU 的控制能力,并延续每个版本在功能与性能上的改进。
Google Cloud 宣布 AlloyDB Omni Red Hat RPM orchestrator 正式 GA,随 AlloyDB Omni 18.3.0 一同发布,可在虚拟机与裸金属服务器上实现高可用企业级 PostgreSQL 部署。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。Mistral 称这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力、基础设施和商业增长。公司目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲科技公司规模最大的股权融资,读者可了解其主权 AI 全栈路线与投资方结构。
2026 年 9 月,NVIDIA 宣布投入 Rust 原生 GPU 编程,推出 CUDA Rust,提供两条编写 GPU kernel 的路线。CUDA C++ 和 CUDA Python 仍是成熟的企业级工具链,NVIDIA 将持续把 CUDA Rust 发展和成熟至 2027 年及以后,以应对涵盖推理引擎、服务基础设施、驱动和 Agent runtime 的 AI 系统层需求。
The H100 is a three-year-old training chip. Its rental price is up 22 percent on the month, to $3.28 an hour. Every depreciation schedule assumes a chip this old only loses value. The market is paying up for it instead.
vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。
推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。
vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。
SemiAnalysis 在 InferenceX 官方预览中发布首个 TPUv7 Ironwood 第三方推理结果,FP8 聚合服务下每美元性能最高比 B200/B300 好 50%,20 tok/s/user 时每百万 token 成本 0.181 美元,低于 B200 的 0.222 美元和 B300 的 0.276 美元。
vLLM 推出 TT Plugin,通过 out-of-tree 平台插件机制将 Tenstorrent 加速器接入 vLLM,安装后只要 ttnn 可导入即自动注册为 vLLM 平台,OpenAI 兼容 API 与请求格式保持不变。
NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。
a16z 宣布投资 Gimlet Labs,后者正在构建首个多芯片推理云,可在同一功耗范围内为前沿模型带来最高 10 倍吞吐与交互性提升。Gimlet 通过编译器与运行时把不同模型和工具调度到 GPU、CPU 及专用加速器上,并将编排延伸至数据中心层面,对开发者只暴露单一推理 API。其客户已包括一家前沿实验室和一家超大规模云厂商。
Introducing GLM-5.3-Flash - Leading capabilities at a highly competitive price - Natively multimodal with a 1M-token context window - A 320B-A18B model released under the MIT License - Previously previewed as Ox Alpha, running entirely on Chinese AI chips Blog: http://z.ai/blog/glm-5.3-flash Available now across all official platforms: Weights: http://huggingface.co/zai-org/GLM-5.3-Flash API: http://docs.z.ai/guides/llm/glm-5.3-flash Coding Plan: http://z.ai/subscribe ZCode: http://zcode.z.ai/en Chat: http://chat.z.ai AutoClaw: http://autoclaw.z.ai
推荐理由:原文给出本地推理提速的具体配置和硬件门槛,读者可以直接复用到自己的 GLM-5.3-Flash 部署中。
NVIDIA 技术博客介绍如何在联邦 Kubernetes 与 AI 平台间传递用户身份。现代 AI 平台中用户从中央门户进入、打开受治理数据集、启动 notebook 并调用另一集群中的助手,身份在每一步都跨越控制面与数据面边界,传统单点登录在此失效。
对于今早孟菲斯计算中心宕机后您可能在使用 Grok 时遇到的问题,我们深表歉意。我们也要向受影响的计算合作伙伴致歉。 目前所有系统均已恢复,运行正常。
Meta 推出 ZGateway,作为统一 ZippyDB 客户端流量的无状态代理层,承载约 40% 的 ZippyDB 流量,可处理超过 10 亿次/秒的操作,平均用例仅增加约 6% 计算开销。
NVIDIA 推出 PAIR 虚拟推理路由器,可将本地网络中的可用算力扩展给 AI 智能体使用。该方案面向多智能体协作场景:主智能体把复杂任务拆解后分派给专用子智能体,用户也会同时运行多个智能体会话。这种广度优先的方式可提升任务完成速度。
Hugging Face 发布教程,用 TRL 库对 LiquidAI/LFM2.5-350M 做 GRPO 微调,仅用约 500 个样本和 100 步训练,将其在 IFStruct benchmark 上的通过率从 22.6% 提升到 29.7%。
推荐理由:教程给出完整可复现的低成本 GRPO 微调流程和逐项评测数字,读者可以照着在免费 GPU 上复刻这一结构化输出改进方法。
NVIDIA 技术博客发布 CUDA 优化实战教程,以一个 RGB 转灰度并计算分块的图像处理管线为例,通过六个增量步骤演示如何用 Compute Sanitizer 和 CCCL 新索引 API 排查越界错误。
NVIDIA 技术博客发布 AI 模型协同设计系列第三篇,探讨如何用投机解码在保持精度的同时加速 LLM 推理。文章给出五条指南,用于在帕累托前沿上选择草稿长度与草稿机制。
微软提出 AI 基础设施的“良率命题”,主张衡量标准应从建了多少算力转向产出多少有用智能。文中指出单个智能体任务消耗的 token 可达普通对话的 3400 倍以上,而全球 AI 渗透率仅为劳动人口的 18%,且以聊天为主。微软认为内存、网络与功耗的瓶颈需通过跨层协同设计解决,而非在单层堆叠资源。
SemiAnalysis 深度分析韩国主权 AI 战略:政府以锦标赛制推进“独立 AI 基础模型”项目,从 15 个联合体中选出 Naver Cloud、LG AI Research、SK Telecom、NC AI、Upstage 五队,首轮后淘汰 NC AI 并因使用阿里 Qwen 视觉与音频编码器取消 Naver 资格,递补 Motif Technologies。
NVIDIA 技术博客探讨企业如何为 AI 推理负载合理配置 GPU 并优化总体拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 资源规划变得困难。
vLLM-Omni 团队发布 MiniMax H3 服务优化详解,先对完整管线做无损系统级优化,相比 Diffusers 将完整响应延迟降低 30.8%(1.445x)。