跳到正文
原文
vLLM 官方博客(RSS)· Ranran Haoran Zhang, Lik Xun Yuan, Chao Ju Chen, Eric Curtin, Michael Goin·· 9 天前精选AI 评分76

vLLM 官方发布 vllm-metal v0.28.0:在 Apple Silicon 上实现并发推理服务

Announcing vllm-metal: Concurrent Serving on Apple Silicon

AI 导读

vLLM 官方宣布 vllm-metal 首个正式版本 v0.28.0,将上游 vLLM 的 V1 调度器、分页 KV cache 和 OpenAI 兼容服务带到 Apple Silicon,模型执行由 MLX 和 Metal 完成。

推荐理由

官方详解 vllm-metal 的架构与跨引擎实测数据,读者可据此评估 Apple Silicon 上多并发推理是否值得切换。

来源:vLLM 官方博客(RSS) · vllm.ai