LMSYS:Blog(Chatbot Arena 团队)·· 13 小时前AI 评分48
SGLang 为 GLM-5.2 NVFP4 智能体负载提速:8xB300 上突破 500 TPS
Blog Serving GLM5.2 NVFP4 Agentic Workload with SGLang: Reaching 500 TPS in 2 Weeks - More than 500 TPS on 8xB300 (bs=1) - Sync free speculative decoding for GLM 5.2 MTP - Built-in IndexShare MTP with Spec V2 - 2.33x faster TopK-V2 for ISL 80k - Indexer prologue fusion - Gemm kernels... SGLang Team July 14, 2026
AI 导读
SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org