vLLM 官方博客(RSS)· vLLM Team·· 2026-07-15精选AI 评分80
vLLM 实现 TML Inkling Day-0 支持:1T 参数多模态模型最高 380 tok/s/user
TML Inkling on vLLM: Day-0 Support with Optimized Performance
AI 导读
vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。
推荐理由
官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。
来源:vLLM 官方博客(RSS) · vllm.ai