热点事件持续更新
SGLang 优化 GLM-5.2 NVFP4 推理至 500 TPS
1 篇报道1 个报道来源13 小时前更新
先了解这件事
AI 综述
2026-09-30,LMSYS 旗下 SGLang 团队发布博客,介绍针对 GLM-5.2 NVFP4 检查点的推理优化工作。该优化面向智能体负载,在 8xB300、batch size 为 1 的配置下实现超过 500 TPS,整个优化过程在两周内完成。团队披露两项关键改进:默认开启的 Spec V2 重叠调度带来 11% 的端到端 TPS 提升;IndexShare MTP 使草稿步成本在长上下文场景下最多降低约 1.9 倍。目前该优化已随 SGLang 发布,事件暂无后续报道或与其他说法的冲突。
AI 根据报道生成 · 5 小时前更新
最新进展9月30日 23:28
SGLang 团队公布 GLM-5.2 NVFP4 优化细节,8xB300 上突破 500 TPS。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- LMSYS:Blog(Chatbot Arena 团队)SGLang 为 GLM-5.2 NVFP4 智能体负载提速:8xB300 上突破 500 TPS
SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。
本事件热度走势
当前热度 7·可比范围峰值 8(10月1日 07:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。