vLLM 官方博客(RSS)· Wentao Ye (Red Hat), Canlin Guo (Huawei), Yongye Zhu (Inferact), Jiangyun Zhu (Inferact), Ziming Huang (Inferact), Wei Zhao (NVIDIA), Michael Goin (Red Hat), Jie Li (Inferact)·· 18 天前AI 评分50
vLLM 中 Kimi K3 性能优化:吞吐量提升至 2.8 倍
Kimi K3 Performance Optimizations in vLLM: The Road to 2.8× Throughput
AI 导读
vLLM 通过自适应投机 token 预算、KDA 前缀检查点、零拷贝混合 KDA 批次和延迟 MXFP4 收尾等优化,将 Kimi K3 服务性能从 v0.27.1 提升至 main:延迟降低 56%–60%,吞吐量提升 2.2–2.8 倍,TTFT 降低 72%–85%(并发 1、4、16,8K/1K 负载,TP8)。
来源:vLLM 官方博客(RSS) · vllm.ai