SGLang 在 NVIDIA GTC 2026 的活动回顾:五场活动、三天
SGLang 团队回顾了在 NVIDIA GTC 2026 的三天五场活动,包括黄仁勋 GTC 主题演讲中 SGLang 出现在 NVIDIA AI 生态幻灯片上,以及 Ying Sheng 参与的"开源 AI 现状"圆桌。
SGLang 团队回顾了在 NVIDIA GTC 2026 的三天五场活动,包括黄仁勋 GTC 主题演讲中 SGLang 出现在 NVIDIA AI 生态幻灯片上,以及 Ying Sheng 参与的"开源 AI 现状"圆桌。
LMSYS 团队提出 HiSparse 分层内存系统,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,8×H200 部署下 256 并发请求吞吐达基线 3 倍以上,长上下文场景最高提升 5 倍。目前支持 DeepSeek-V3.2 与 GLM-5.1 等采用 DSA 的模型,属实验性功能。
LMSYS 的 SGLang 与 Miles 团队宣布对 DeepSeek-V4(1.6T Pro、284B Flash)提供 Day-0 推理和 RL 训练支持,是首个在发布日同时服务与训练该模型的开源栈。
推荐理由:LMSYS 团队详述了为 DeepSeek-V4 混合稀疏注意力等新架构所做的推理与 RL 训练优化,附基准数据。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,作为传统 NCCL broadcast 的补充,兼容所有主流开源模型。
AMD 与 SGLang 团队联合发布博客,展示基于 SGLang 和 MoRI 通信库的 DeepSeek-R1 分离式推理在 AMD Instinct MI355X 上实现有竞争力的 TCO,结果由 SemiAnalysis 的 InferenceX 基准平台验证。
Intel 与 SGLang 团队通过 Dynamo 和 SGLang 为视觉语言模型(VLM)实现异构 Encode-Prefill-Decode(EPD)分离,将视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案在 QPS 1-2 负载下带来约 1.2x-1.3x 的 P99 TTFT 和请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。
推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。
SGLang-Omni 团队宣布为 Boson AI 的 Higgs Audio v3 TTS 提供端到端推理服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持流式合成和 100 种语言的个位数 WER/CER,开发者可通过文本流内嵌控制标签调节情绪、风格、韵律和音效。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求智能体 RL 中每一轮的总 token 序列(prompt + response)必须是下一轮 prompt token 序列的逐位完美前缀,以保证训练与推理一致。
LMSYS 宣布 2026 博士奖学金首位获得者为 Will Lin,表彰其对开源 AI 基础设施的持续贡献,奖学金最高 5 万美元用于学费。Will Lin 是 UC San Diego 六年级博士生,主导开源扩散生成框架 FastVideo,该项目已获 3.7k+ GitHub stars,并被 NVIDIA Dynamo 集成为后端。
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
MOSS-TTS-Local-Transformer-v1.5 已在 SGLang-Omni 上实现端到端服务,与 MOSI 和 OpenMOSS 团队合作完成。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms,降幅 53%。
SGLang 为 DeepEP MoE 推理引入 Waterfill 和 LPLB 两项调度期负载均衡特性。
SGLang 团队发布博客,介绍将开发流程编码为可执行 skills 的初步探索,覆盖 CUDA 崩溃调试、基准测试、profiling、扩散模型接入和生产事故分诊。
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较 Host DRAM 方案降低 6.7 倍。
DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 与 ROCm 支持,完成四节点端到端验证。
SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。
SGLang 团队与 Thinking Machines Lab 合作,为 975B 参数、1M 上下文的多模态模型 Inkling 提供Day-0推理与 RL 支持,并为 Modal 训练的 DFlash 草稿模型提供投机解码。
推荐理由:原文出自 SGLang 团队,给出针对 Inkling 新架构的具体优化手段和实测吞吐数字,读者可评估其对自建推理或 RL 流程的参考价值。
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。
SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。
推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。
SGLang 提出基于 Scheme 的量化架构重构(issue #15194),将量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式与硬件后端可独立演进。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
RadixArk 与 Google Cloud 宣布合作,把开源推理框架 SGLang 带到 Google TPU 上。
LMSYS SpecForge 团队发布 SpecForge v0.3.0,将目标模型推理与草稿模型训练解耦,统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并用 YAML 单一入口配置拓扑。
SGL-Diffusion 团队用 SRT 替换 HF 后端,将 AR 阶段从扩散 worker 中解耦为独立服务,使 AR 可单独配置 TP、DiT 保留 SP。
腾讯混元 AI Infra 与 SGLang 团队宣布,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已合入 SGLang 主分支。
SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。
推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。
SGLang 发布 Unified Radix Cache,用单一 token 基数树统一 full attention KV、滑动窗口 KV 与 Mamba 循环状态的复用边界,替代此前的缓存类矩阵。
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,这是一款可定制的开源模型,总参数 30B、每 token 仅激活 3B,上下文最长 100 万 token,由 Nemotron 3 Ultra 蒸馏而来。
SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。
推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。
SGLang 团队详解其 CUDA Graph 重构,将支持拆分为 runner/backend 两层,使不同捕获策略可跨执行路径复用。
RadixArk 发布 Miles v0.1,一个面向前沿后训练的全栈生产级系统,是首个 Miles 版本的继任者。它基于 slime 设计,用 SGLang 做 rollout、NVIDIA Megatron-LM 或 FSDP 做训练,支持全异步 RL、三种评估模式和可插拔智能体环境,并附带智能体编码与终端任务的端到端配方。
LMSYS 博客给出 1.6 万亿参数 MoE 模型 DeepSeek-V4-Pro 在 H20 GPU 上的服务优化方案,单节点 H20-141GB 在 batch size 1 下达到 271 output tokens/s,与 B300 的 383.7 tokens/s 相比解码性能差距缩小至 1.42×。
Mooncake 社区发布博客,介绍 Mooncake 如何为大规模强化学习框架 Miles 解决 rollout 数据传输瓶颈。
蚂蚁集团基础设施团队联合阿里巴巴与 SGLang 团队推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝映射将常驻 GPU 的量化后权重直接提供给新的 SGLang 引擎实例。
METR 汇总了多家 AI 公司发布的前沿 AI 安全政策清单,涵盖 Amazon、Anthropic、Google DeepMind、G42、Meta、Microsoft、OpenAI 和 xAI。该清单发布于 2025 年 2 月 8 日,原文为西班牙语,可阅读英文版本。
METR 发布隐私政策,说明其网站对未受全面数据保护地区(如美国)的访客加载 Google Analytics,对 145 个司法管辖区及发送 DNT/GPC 信号的访客不加载任何追踪。招聘流程通过 Lever 进行,并使用 AI 检测服务 Pangram 筛查申请材料,被判定为几乎完全由 AI 生成的申请会被转入降级处理阶段。
METR 是一家研究非营利机构,致力于评估前沿 AI 系统是否可能对社会构成灾难性风险,并构建准确评估风险的科学方法。其部分开源智能体可在 github.com/poking-agents 找到,Vivaria 项目已弃用。