vLLM 官方博客(RSS)· vLLM Team·· 10 天前AI 评分35
vLLM 在 GB300 NVL72 上 PD 部署 Qwen3.8-2.4T 的性能结果
PD Serving of Qwen3.8-2.4T
AI 导读
vLLM 公布 Qwen3.8-2.4T 在 GB300 NVL72 集群上的 PD 分离部署结果:8K/1K 负载下高吞吐场景达每 GPU 5000 total token 吞吐,低延迟场景每用户 180 生成 token,并给出完整 pareto 前沿。
来源:vLLM 官方博客(RSS) · vllm.ai