跳到正文
热点事件持续更新

SGLang推出EPD架构并实现异构CPU+GPU分离

2 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年9月30日,LMSYS(Chatbot Arena 团队)在官方博客发布消息,SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构。该架构将视觉语言模型(VLM)的视觉编码与语言处理拆分为三层,使编码器服务器可以独立横向扩展,从而为 VLM 实现弹性编码器扩展。同日后续报道称,Intel 与 SGLang 团队通过 Dynamo 和 SGLang 为 VLM 实现异构 EPD 分离,将视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案在 QPS 1-2 负载下带来约 1.2x-1.3x 的 P99 TTFT 和请求吞吐提升,P99 TPOT 降低约 1.3x-30x。

AI 根据报道生成 · 11 小时前更新

事件进展

2 个进展
  1. 9月30日 23:28 · 1 篇报道
    SGLang引入EPD架构分离VLM视觉编码与语言处理
    LMSYS:Blog(Chatbot Arena 团队):SGLang 推出 EPD 分离架构:为视觉语言模型实现弹性编码器扩展
  2. 9月30日 23:28 · 1 篇报道
    SGLang与Dynamo实现VLM异构CPU+GPU EPD分离优化
    LMSYS:Blog(Chatbot Arena 团队):Intel 与 SGLang 团队用 Dynamo 实现异构 CPU+GPU EPD 分离,加速 VLM 推理

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. LMSYS:Blog(Chatbot Arena 团队)
    SGLang 推出 EPD 分离架构:为视觉语言模型实现弹性编码器扩展

    SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉语言模型(VLM)的视觉编码与语言处理拆分为三层,使编码器服务器可独立横向扩展。

  2. LMSYS:Blog(Chatbot Arena 团队)
    Intel 与 SGLang 团队用 Dynamo 实现异构 CPU+GPU EPD 分离,加速 VLM 推理

    Intel 与 SGLang 团队通过 Dynamo 和 SGLang 为视觉语言模型(VLM)实现异构 Encode-Prefill-Decode(EPD)分离,将视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案在 QPS 1-2 负载下带来约 1.2x-1.3x 的 P99 TTFT 和请求吞吐提升,P99 TPOT 降低约 1.3x-30x。

本事件热度走势

当前热度 7·可比范围峰值 10(10月1日 01:00)·近 24 小时可比范围变化 –

02.557.51010月1日01:0010月1日04:0010月1日08:0010月1日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。