跳到正文
原文
NVIDIA Technical Blog(开发者技术博客 · RSS)· Elizabeth Goodman·· 16 天前AI 评分34

Dense 与 MoE 模型对比:活跃参数、吞吐量与选型时机

Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each

AI 导读

NVIDIA 技术博客对比 Dense 与 MoE 两种模型架构,说明参数组织方式对性能的影响。以 Nemotron 3.5 Lightning 为例,该模型总参数 30B,但每个 token 仅激活 3B 参数,依靠 MoE 架构按 token 选择部分参数,从而在保留大模型容量的同时降低单次计算量。文章围绕活跃参数、吞吐量与选型时机展开分析。

来源:NVIDIA Technical Blog(开发者技术博客 · RSS) · developer.nvidia.com