跳到正文
原文
vLLM 官方博客(RSS)· vLLM Team·· 2026-08-06AI 评分42

vLLM 在 Qwen3.5 上实现 25K 总 TPS/GPU

vLLM Reaches 25K Total TPS/GPU on Qwen3.5

AI 导读

vLLM 社区完成 Qwen3.5 混合注意力架构的分离式服务优化,在 GB200 NVL72 系统上实现超过 25K 总 TPS/GPU。

来源:vLLM 官方博客(RSS) · vllm.ai