vLLM 官方博客(RSS)· vLLM Team·2026-08-06 08:00· 2026-08-06AI 评分42vLLM 在 Qwen3.5 上实现 25K 总 TPS/GPUvLLM Reaches 25K Total TPS/GPU on Qwen3.5AI 导读vLLM 社区完成 Qwen3.5 混合注意力架构的分离式服务优化,在 GB200 NVL72 系统上实现超过 25K 总 TPS/GPU。来源:vLLM 官方博客(RSS) · vllm.ai#产品更新#部署/工程#推理