vLLM 官方博客(RSS)· DaoCloud Team·· 2026-07-23AI 评分63
DaoCloud 团队用 24 块 NVIDIA B300 和 vLLM 生产级服务 GLM-5.2-NVFP4
From Day 0 to Production SLAs: Serving GLM-5.2 on 24 NVIDIA B300 GPUs with vLLM
AI 导读
DaoCloud 团队在 3 台 8 卡 B300 服务器(共 24 GPU)上以 4 Prefill + 1 Decode 分离拓扑部署 GLM-5.2-NVFP4,在 mean TTFT ≤ 2.5s、mean TPOT ≤ 20ms 的 SLA 下,将 16K 输入的 mean TPOT 从约 40ms 优化到约 17ms。
来源:vLLM 官方博客(RSS) · vllm.ai