跳到正文
原文
vLLM 官方博客(RSS)· vLLM Team·· 2026-07-15精选AI 评分80

vLLM 实现 TML Inkling Day-0 支持:1T 参数多模态模型最高 380 tok/s/user

TML Inkling on vLLM: Day-0 Support with Optimized Performance

AI 导读

vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。

推荐理由

官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。

来源:vLLM 官方博客(RSS) · vllm.ai