vLLM 官方博客(RSS)· vLLM-Omni Diffusion Team·· 2026-08-17AI 评分50
vLLM-Omni 推出分布式逐层卸载,可在多卡上高效运行 200B+ 级 DiT 模型
Distributed Layerwise Offload: Scaling Toward 200B+ DiT Models Efficiently in vLLM-Omni
AI 导读
vLLM-Omni 团队发布 Distributed Layerwise Offload,让超过单卡 HBM 的视频生成模型(如 Cosmos3-Super 64B / 124 GB)可在多块 NPU 或 GPU 上运行。
来源:vLLM 官方博客(RSS) · vllm.ai