跳到正文
热点事件持续更新

SGLang 优化 GLM-5.2 NVFP4 推理至 500 TPS

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026-09-30,LMSYS 旗下 SGLang 团队发布博客,介绍针对 GLM-5.2 NVFP4 检查点的推理优化工作。该优化面向智能体负载,在 8xB300、batch size 为 1 的配置下实现超过 500 TPS,整个优化过程在两周内完成。团队披露两项关键改进:默认开启的 Spec V2 重叠调度带来 11% 的端到端 TPS 提升;IndexShare MTP 使草稿步成本在长上下文场景下最多降低约 1.9 倍。目前该优化已随 SGLang 发布,事件暂无后续报道或与其他说法的冲突。

AI 根据报道生成 · 5 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. LMSYS:Blog(Chatbot Arena 团队)
    SGLang 为 GLM-5.2 NVFP4 智能体负载提速:8xB300 上突破 500 TPS

    SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。

本事件热度走势

当前热度 7·可比范围峰值 8(10月1日 07:00)·近 24 小时可比范围变化 –

0246810月1日07:0010月1日08:0010月1日10:0010月1日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。