SGLang 在 GB200 NVL72 部署 DeepSeek 推理
先了解这件事
2026年10月2日,LMSYS 博客(Chatbot Arena 团队)发布多篇报道,称 SGLang 团队在 GB200 NVL72 上部署 DeepSeek 671B/V3/R1 模型,采用 PD 分离、大规模专家并行、FP8 attention 与 NVFP4 MoE 等方案优化推理。早先报道称,该部署在解码阶段实现每 GPU 每秒 7,583 tokens,在 2,000 token 输入长度下相比 H100 每 GPU 性能提升 2.7 倍。同日稍后报道称,SGLang 与 NVIDIA 合作在 Blackwell 架构上优化推理,在 GB200 NVL72 上运行 DeepSeek R1 时每 GPU 实现 26k 输入和 13k 输出 tokens/秒的 prefill 与 decode 性能;另一篇报道进一步给出具体数字:2000-token 输入序列下每 GPU 预填充达 26,156 tokens/s、解码达 13,386 tokens/s,较 H100 分别提速 3.8 倍和 4.8 倍。早先报道称解码吞吐为每 GPU 每秒 7,583 tokens、提速 2.7 倍,后续报道称每 GPU 每秒 13k 输出 tokens、解码提速 4.8 倍,两者不一致。目前该事件仅有同日多篇报道,尚无进一步进展。
AI 根据报道生成 · 1 小时前更新
事件进展
2 个进展
- 10月2日 22:51 · 1 篇报道SGLang 在 GB200 NVL72 上部署 DeepSeek 671BLMSYS:Blog(Chatbot Arena 团队):SGLang 在 GB200 NVL72 上部署 DeepSeek 671B:解码吞吐提升 2.7 倍
- 10月2日 22:51 · 2 篇报道SGLang与NVIDIA优化Blackwell推理性能LMSYS:Blog(Chatbot Arena 团队):SGLang 与 NVIDIA 在 SemiAnalysis InferenceMAX 及 GB200 上加速推理
报道时间线
沿着报道,了解事件的不同侧面。
- LMSYS:Blog(Chatbot Arena 团队)SGLang 在 GB200 NVL72 上部署 DeepSeek 671B:解码吞吐提升 2.7 倍
SGLang 团队在 GB200 NVL72 上以 PD 分离和大规模专家并行运行 DeepSeek 671B,解码阶段实现每 GPU 每秒 7,583 tokens,相比 H100 每 GPU 提升 2.7 倍(2,000 token 输入长度)。
- LMSYS:Blog(Chatbot Arena 团队)SGLang 在 GB200 NVL72 上部署 DeepSeek V3/R1:预填充提速 3.8 倍、解码提速 4.8 倍
SGLang 团队在 GB200 NVL72 上优化 DeepSeek V3/R1 推理,采用 FP8 attention 与 NVFP4 MoE 后,2000-token 输入序列下每 GPU 预填充达 26,156 tokens/s、解码达 13,386 tokens/s,较 H100 分别提速 3.8 倍和 4.8 倍。
- LMSYS:Blog(Chatbot Arena 团队)SGLang 与 NVIDIA 在 SemiAnalysis InferenceMAX 及 GB200 上加速推理
SGLang 与 NVIDIA 合作在 Blackwell 架构上优化推理,在 GB200 NVL72 上运行 DeepSeek R1 时每 GPU 实现 26k 输入和 13k 输出 tokens/秒的 prefill 与 decode 性能。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。