vLLM 官方博客(RSS)· vLLM-Omni Community, Intel AutoRound Team·· 2026-06-02AI 评分48
vLLM-Omni 集成 Intel AutoRound 量化:W4A16 加速多模态推理
Accelerating vLLM-Omni Inference with AutoRound Quantization
AI 导读
Intel 的 AutoRound 训练后量化算法已完整集成进 vLLM-Omni,支持 W4A16 量化并实现"一次量化、直接部署"流程。Qwen3-Omni-30B-A3B 的 checkpoint 从 66 GB 降至 25 GB,体积减少最多 62%,其 W4A16 版本在 OmniBench 上得分略优于 BF16 参考,文生图质量漂移仅约 1.3%。
来源:vLLM 官方博客(RSS) · vllm.ai