跳到正文
原文
LMSYS:Blog(Chatbot Arena 团队)·· 12 小时前AI 评分36

Intel 与 SGLang 团队用 Dynamo 实现异构 CPU+GPU EPD 分离,加速 VLM 推理

Blog Heterogeneous CPU + GPU EPD Disaggregation to Boost VLM Serving TL;DR We enabled heterogeneous Encode-Prefill-Decode (EPD) disaggregation via Dynamo and SGLang for Vision-Language Models (VLMs). By offloading vision encoding tasks to CPUs (the easiest-getting CPU... Intel & SGLang Team May 29, 2026

AI 导读

Intel 与 SGLang 团队通过 Dynamo 和 SGLang 为视觉语言模型(VLM)实现异构 Encode-Prefill-Decode(EPD)分离,将视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案在 QPS 1-2 负载下带来约 1.2x-1.3x 的 P99 TTFT 和请求吞吐提升,P99 TPOT 降低约 1.3x-30x。

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org