vLLM 如何用 Decode Context Parallelism 优化长上下文推理
vLLM 详解 Decode Context Parallelism(DCP):将 KV cache 沿序列维度切分到各 GPU,而非像 TP 那样按注意力头切分,从而突破 GQA 和 MLA 模型下 KV cache 复制导致的内存瓶颈。
vLLM 详解 Decode Context Parallelism(DCP):将 KV cache 沿序列维度切分到各 GPU,而非像 TP 那样按注意力头切分,从而突破 GQA 和 MLA 模型下 KV cache 复制导致的内存瓶颈。
vLLM 社区完成 Qwen3.5 混合注意力架构的分离式服务优化,在 GB200 NVL72 系统上实现超过 25K 总 TPS/GPU。
Baseten 正式加入 Hugging Face Hub 的 Inference Provider 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。
Chips and Cheese 评析 NVIDIA 45 页 Vera 白皮书,认为 Olympus 核心(10 宽解码、值预测、88 核单die、1.2 TB/s LPDDR5X)确实强劲。
Google Cloud 的 Database Migration Service(DMS)可自动将 SQL Server 多结果集存储过程转换为 PostgreSQL 的 SETOF refcursor 结构。
Target 基于 Spanner Graph 构建企业本体,将图关系、向量嵌入、全文检索与事务数据统一到同一数据库引擎,替代原有 Elasticsearch 加 NoSQL 的碎片化架构。迁移采用零停机四阶段方案,完成后下线旧 Elasticsearch 集群,数据库维护成本降低 50%。该平台为 Gift Finder 等对话式购物助手提供结构化上下文,支撑 GraphRAG 式商品发现。
安全研究者 Johann Rehberger 发布 LLM Heist 攻击链研究,演示仅用 LiteLLM 的 /model/update 等合法管理功能,将 api_base 指向攻击者网关并开启 use_litellm_proxy,即可重路由全部 LLM 流量、捕获后端 provider 密钥、监控对话并注入伪造响应与工具调用。
Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。
推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。
安全研究员披露 PipeWire 的 PulseAudio 兼容层漏洞 CVE-2026-5674(CVSS 8.8),仅拥有音频权限的 Flatpak 应用即可逃逸沙箱并以用户身份执行任意代码。
企业 AI 的下一个真正约束是 GPU 利用率而非模型智能,闲置 GPU 与停飞飞机一样按日历小时累积成本、却只按计算小时产生产出。
Sierra 发布 Agency,一个基于 Kubernetes 的智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 分无状态控制平面与有状态 runner 两层,通过 IAM 鉴权、DynamoDB 记录状态,每个 runner 配备 8+ 核、24GiB 内存和持久化存储。默认不向智能体暴露任何 API key 或密钥。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。
vLLM 联合 PyTorch、oneDNN 和 KleidiAI 社区完成 Arm CPU 服务栈的上游优化,新增预构建 wheel 与 Docker 镜像、chunked prefill、前缀缓存、INT8 W8A8/W4A8 推理,并支持 GPT-OSS、Whisper 和 Qwen 3.5/3.6。
Together AI 联合佐治亚理工、UIUC 和 CMU 推出 ThunderAgent,一种高吞吐智能体推理调度系统,论文被 ICML 2026 接收为 Spotlight。
vLLM 与 Speculators 为 P-EAGLE、DFlash、DSpark 三种并行草稿(parallel drafting)算法提供完整开源支持,相关模型已发布在 RedHatAI HuggingFace Hub 的 Speculators Collection 中。
Chips and Cheese 在 AMD Advancing AI 2026 活动上采访了 AMD 企业院士、数据中心 GPU 首席架构师 Alan Smith,谈新发布的 CDNA5 架构(用于 MI455 和 Helios)。
vLLM 宣布对月之暗面 Kimi K3 提供 Day-0 高效支持。Kimi K3 是 2.8 万亿参数的 MoE 多模态模型,每 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口。
推荐理由:vLLM 官方详述 Kimi K3 的服务适配与内核优化,读者可以据此了解 2.8T 混合 MoE 的生产部署配方和性能数据。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。
Together AI 推出 Dedicated Model Inference 平台,为在生产中运行开放权重、授权闭源权重和微调模型提供统一服务。
DaoCloud 团队在 3 台 8 卡 B300 服务器(共 24 GPU)上以 4 Prefill + 1 Decode 分离拓扑部署 GLM-5.2-NVFP4,在 mean TTFT ≤ 2.5s、mean TPOT ≤ 20ms 的 SLA 下,将 16K 输入的 mean TPOT 从约 40ms 优化到约 17ms。
vLLM 推出实验性外部插件 vLLM AFD Plugin,将 MoE 模型中的 Attention 与 FFN 拆分为可独立部署和扩缩的服务,同时保留 vLLM 原有请求生命周期与 OpenAI 兼容接口。
Sierra 工程师 Mihai Parparita 发布长文,复盘公司内部 MCP Gateway 的构建过程,该网关基于 Model Context Protocol 将 AI 智能体安全接入内部工具。
推荐理由:作者以第一手复盘提炼七条工程经验,覆盖权限设计、Agent 校验与身份管理,方法对自建 Agent 基础设施可直接借鉴。
vLLM 发布 Kimi K3 生产级支持的预览博客,正与 Moonshot AI、NVIDIA、AMD 等推进最终集成,计划在 2026 年 7 月 27 日权重发布时提供 day-0 开源服务,包括模型实现、Docker 镜像和部署方案。
推荐理由:vLLM 团队详解 KDA 混合架构带来的前缀缓存改造与内核优化,对部署混合注意力模型的工程团队有可迁移参考价值。
vLLM Semantic Router 提出 Mixture-of-Models(MoM)架构,目标是在同一版本化契约下把独立模型、策略、偏好与执行路径组合成可训练、评估、导出、部署和调用的模型系统。
Microsoft 将 AMD 最新 Helios AI 平台和下一代 EPYC 数据中心处理器引入 Azure,推出三款新虚拟机:用于数据处理的 HDv2、用于电子设计自动化的 HXv2,以及用于 AI 推理的 ND MI455X v7。
Together AI 与 Y Combinator 宣布合作推出首个 YC 专属 GPU 集群,为 YC 投资组合中的 AI 初创公司提供推理和训练算力。初创公司可通过 Together 自助门户直接预留和管理 GPU,几分钟内就绪,支持短期冲刺并按长期费率计费,无需长期承诺。该集群目前已满负荷运行,双方计划后续扩展规模。
vLLM 团队介绍其如何在高合并节奏下保持发布稳定:2026 年 6 月共合并 1,918 个 commit(日均 64 个),CI 包含 37 个测试组、266 个任务,使用共享容器镜像和 pip-compile 锁定依赖,并依赖 58 个 runner 队列的异构硬件。
Together AI 发文解释推理服务 99.9% 可用性的实际含义,自述为 Cursor、Decagon、Cartesia、Yutori 等团队提供推理。文章按层拆解故障模式(计算、网络、存储、软件),说明 99%、99.9%、99.99% 各等级分别要求抗节点故障、抗单数据中心故障和抗区域故障,强调多活双设施部署与自持基础设施的差异。
Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。
推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。
IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。
推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。
vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。
推荐理由:官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。
Together 为 GPU Clusters 推出被动健康检查、自动节点修复和基于 Slinky 1.0 重建的 Slurm-on-K8s 2.0 栈。被动检查持续监控 GPU 掉总线、热降频、Xid 错误等故障,自动节点修复提供 Reboot、Reprovision、Failover、Remove 四种操作,由人工确认后执行。
vLLM 通过 V1 的公开 connector 接口接入 TileRT 作为专用 decode 引擎,随 TileRT 0.1.5 发布,prefill、调度、前缀缓存与 API 均保持原生 vLLM 不变。
vLLM 与 AMD Quark 团队展示了在 AMD Instinct MI355X GPU 上训练和部署 EAGLE3 投机解码的完整流程,覆盖 Kimi-K2.5 与 MiniMax-M2.5,并用 InferenceX 做基准测试。
蚂蚁 inclusionAI 在 GitHub 发布新仓库 distill-fs,这是一个只读 FUSE 文件系统,可直接挂载原始磁盘镜像和 Nydus RAFS 镜像。该工具面向镜像内容的只读访问场景,目前仓库信息仅说明其支持的两类镜像格式。
蚂蚁 inclusionAI 在 GitHub 新建仓库 inclusionAI/vllm,定位为面向 LLM 的高吞吐、内存高效推理与服务引擎。该仓库目前仅给出这一句项目描述,未披露具体模型支持、性能数据或版本信息。
蚂蚁 inclusionAI 在 GitHub 新建 sglang 仓库,定位为面向大语言模型和多模态模型的高性能服务框架。该仓库目前仅给出这一定位描述,未披露具体版本号、性能数据或开源许可等细节。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 profiler trace 对比手写注意力、in-place 掩码、SDPA math/efficient/flash/cuDNN 各后端的 kernel 表现。
推荐理由:原文用 profiler trace 逐一对比 PyTorch 各注意力实现的 kernel 差异,读者可以学到一套先猜测再看 trace 的可迁移分析方法。
vLLM 生态的强化学习框架 vime 现已支持 ROCm,可在 AMD Instinct MI355X GPU 上原生运行大规模 RL 后训练。vime 采用 Megatron 训练、vLLM 推理与数据缓冲三段解耦架构,整条流水线已在 ROCm 上完成端到端验证,并同步上游 ROCm 相关修复、提供预构建容器。