vLLM 官方博客(RSS)· vLLM Team·· 23 天前AI 评分45
GLM 5.3 优化第一部分:vLLM 中的 Hybrid HiSparse 卸载
GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM
AI 导读
vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。
来源:vLLM 官方博客(RSS) · vllm.ai