跳到正文
原文
NVIDIA Technical Blog(开发者技术博客 · RSS)· Elizabeth Goodman·· 21 天前AI 评分29

全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户

How Full-Stack NIM Optimizations Deliver 2.5x More Users on Nemotron 3 Ultra

AI 导读

NVIDIA 通过全栈 NIM 优化,在 Nemotron 3 Ultra 上实现 2.5 倍并发用户量。该优化针对生产环境部署大语言模型时,在现有 GPU 基础设施上提升并发服务能力并保持交互响应速度的需求,对提示词长、上下文跨步骤复用的智能体 AI 工作负载尤为关键。

来源:NVIDIA Technical Blog(开发者技术博客 · RSS) · developer.nvidia.com