SGLang Diffusion 发布:为扩散模型图像与视频生成提速 1.2x-5.9x
Blog SGLang Diffusion: Accelerating Video and Image Generation We are excited to introduce SGLang Diffusion, which brings SGLang's state-of-the-art performance to accelerate image and video generation for diffusion models. SGLang Diffusion supports major open-sou... The SGLang Diffusion Team November 7, 2025
LMSYS Chatbot Arena 团队发布 SGLang Diffusion,将 SGLang 的高性能推理引入扩散模型,在 H100 和 H200 的基准测试中相比 Hugging Face Diffusers 提供 1.2x-5.9x 加速。
原文给出在 H100 和 H200 上对比 Hugging Face Diffusers 的 1.2x 到 5.9x 加速数据,以及支持的模型和 API 入口,读者可据此评估是否迁移现有扩散模型推理工作流。
我们非常高兴推出 SGLang Diffusion,它将 SGLang 的最先进性能带入扩散模型,加速图像和视频生成。 SGLang Diffusion 支持主流的开源视频和图像生成模型(Wan、Hunyuan、Qwen-Image、Qwen-Image-Edit、Flux),同时通过多种 API 入口(兼容 OpenAI 的 API、CLI、Python 接口)提供快速推理速度和易用性。SGLang Diffusion 在各种工作负载下可实现 1.2 倍至 5.9 倍的加速。 我们与 FastVideo 团队合作,为扩散模型提供完整的生态系统,涵盖从后训练到生产部署的全流程。代码可在此处获取。文档可在此处获取。
SGL Diffusion 在 H100 GPU 上的性能基准测试
SGLang Diffusion 在 H200 GPU 上的性能基准测试
为什么要在 SGLang 中做扩散?
随着扩散模型成为最先进图像和视频生成的支柱,我们听到了社区强烈的呼声,希望将 SGLang 标志性的性能和无缝用户体验带到这些新模态中。我们构建 SGLang Diffusion 正是为了回应这一需求,为语言和扩散任务提供统一的高性能引擎。
这种统一的方法至关重要,因为生成的未来在于架构的融合。 前沿模型已经在融合自回归(AR)和基于扩散的方法的优势——从字节跳动的 Bagel 和 Meta 的 Transfusion 等使用单一 transformer 完成两项任务的模型,到 NVIDIA 的 Fast-dLLM v2 将 AR 模型适配为并行生成。
SGLang Diffusion 被设计为一个面向未来、高性能的解决方案,随时准备为这些创新系统提供动力。
架构
SGLang Diffusion 兼顾性能与灵活性,构建于 SGLang 久经考验的服务架构之上。它继承了强大的 SGLang 调度器,并复用高度优化的 sgl-kernel 以实现最大效率。
我们的架构核心设计旨在适应现代扩散模型的多样结构。我们引入了 ComposedPipelineBase,这是一个灵活的抽象,用于编排一系列模块化的 PipelineStage。每个阶段封装一个常见的扩散功能——例如 DenoisingStage 中的去噪循环或 DecodingStage 中的 VAE 解码——使开发者能够轻松组合和复用这些组件,构建复杂、定制化的流水线。
为了实现最先进的速度,我们集成了先进的并行技术。它支持统一序列并行(USP)——即 Ulysses-SP 与 Ring-Attention 的结合——用于核心 transformer 块,同时为其他模型组件提供 CFG 并行和张量并行(TP)。
为了加速开发并培育强大的生态系统,我们的系统构建于 FastVideo 的增强分支之上,我们正与其团队紧密合作。这一合作使 SGLang Diffusion 能够专注于提供前沿的推理速度,而 FastVideo 则为模型蒸馏等训练相关任务提供全面支持。
模型支持
我们支持多种流行的开源视频和图像生成模型,包括:
- 视频模型:Wan 系列、FastWan、Hunyuan
- 图像模型:Qwen-Image、Qwen-Image-Edit、Flux
完整支持模型列表请参考此处。
使用方法
为了提供无缝的用户体验,我们提供了一套熟悉的接口,包括 CLI、Python 引擎 API 和 OpenAI 兼容 API,让用户能够以最小的投入将扩散生成集成到他们的工作流中。
安装
SGLang Diffusion 可以通过多种方式安装:
# with pip or uv
uv pip install 'sglang[diffusion]' --prerelease=allow
# from source
git clone https://github.com/sgl-project/sglang.git
cd sglang
uv pip install -e "python[diffusion]" --prerelease=allow
CLI
启动服务器,然后发送请求:
sglang serve --model-path black-forest-labs/FLUX.1-dev --port 3000
curl http://127.0.0.1:3000/v1/images/generations \
-o >(jq -r '.data[0].b64_json' | base64 --decode > example.png) \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "black-forest-labs/FLUX.1-dev",
"prompt": "A cute baby sea otter",
"n": 1,
"size": "1024x1024",
"response_format": "b64_json"
}'
或者,无需启动服务器即可生成图像:
sglang generate --model-path black-forest-labs/FLUX.1-dev \
--prompt "A Logo With Bold Large Text: SGL Diffusion" \
--save-output
演示
文本到视频:Wan-AI/Wan2.1
sglang generate --model-path Wan-AI/Wan2.1-T2V-1.3B-Diffusers \
--prompt "A curious raccoon" \
--save-output
备用链接:下载视频
图像到视频:Wan-AI/Wan2.1-I2V
sglang generate --model-path=Wan-AI/Wan2.1-I2V-14B-480P-Diffusers \
--prompt="Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard. The fluffy-furred feline gazes directly at the camera with a relaxed expression. Blurred beach scenery forms the background featuring crystal-clear waters, distant green hills, and a blue sky dotted with white clouds. The cat assumes a naturally relaxed posture, as if savoring the sea breeze and warm sunlight. A close-up shot highlights the feline's intricate details and the refreshing atmosphere of the seaside." \
--image-path="https://github.com/Wan-Video/Wan2.2/blob/990af50de458c19590c245151197326e208d7191/examples/i2v_input.JPG?raw=true" \
--num-gpus 2 --enable-cfg-parallel --save-output
备用链接:下载视频
文本到图像:FLUX
sglang generate --model-path black-forest-labs/FLUX.1-dev \
--prompt "A Logo With Bold Large Text: SGL Diffusion" \
--save-output

文本到图像:Qwen-Image
sglang generate --model-path=Qwen/Qwen-Image \
--prompt='A curious raccoon' \
--width=720 --height=720 --save-output

图像到图像:Qwen-Image-Edit
sglang generate --model-path=Qwen/Qwen-Image-Edit \
--prompt="Convert 2D style to 3D style" --image-path="https://github.com/lm-sys/lm-sys.github.io/releases/download/test/TI2I_Qwen_Image_Edit_Input.jpg" \
--width=1536 --height=1024 --save-output

输入

输出
性能基准
如本文顶部的图表所示,我们对比了 SGLang Diffusion 的性能:
- 与流行的开源基线 Hugging Face Diffusers 相比。SGLang Diffusion 提供了最先进的性能,显著加速了图像和视频生成。
- 在不同的并行配置下。CFG-Parallel 和 USP 相比单 GPU 配置都带来了显著的加速。
路线图与扩散生态系统
我们的愿景是与 FastVideo 团队合作构建一个全面的扩散生态系统,提供从模型训练到高性能推理的端到端解决方案。
SGLang Diffusion 团队专注于性能和模型支持的持续创新:
- Model support and optimizations
- 优化 Wan、FastWan、Hunyuan、Qwen-Image 系列、FLUX
- 支持 LongCat-Video
- Kernel support and fusions
- 量化内核
- 旋转嵌入内核
- 在 sgl-kernel 中为 blackwell 集成 Flash Attention 4
- More server features
- 可配置的生成文件云存储上传
- 批处理支持
- 更多并行方法
- 量化
- General architecture:
- 简化支持新模型的工作
- 增强缓存和注意力后端支持
构建这个生态系统是一项社区努力,我们欢迎并鼓励各种形式的贡献。加入我们,共同塑造开源扩散生成的未来。

致谢
SGLang Diffusion 团队:Yuhao Yang、Xinyuan Tong、Yi Zhang、Ke Bao、Ji Li、Xi Chen、Laixin Xie、Yikai Zhu、Mick
FastVideo 团队:Peiyuan Zhang、William Lin、Yongqi Chen、Kevin Lin、Wenxuan Tan、Wei Zhou、Runlong Su、Jinzhe Pan、Hangliang Ding、Matthew Noto、You Zhou、Jiali Chen、Hao Zhang
特别感谢 NVIDIA 和 Voltage Park 提供的算力支持。
了解更多
- 路线图:Diffusion (2025 Q4)
- Slack 频道:#diffusion(通过 slack.sglang.io 加入)
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org