SGLang Day-0 支持 NVIDIA 开源混合 MoE 模型 Nemotron 3 Nano
News SGLang Adds Day-0 Support for the Highly Efficient, Open Nemotron 3 Nano Hybrid MoE Model Jan 28th Update: NVIDIA just released their Nemotron 3 Nano model in NVFP4 precision. This model is supported by SGLang out of the box and it uses a new method called Quantization-Aware Distillation (... NVIDIA Nemotron Team December 15, 2025
SGLang 宣布 Day-0 支持 NVIDIA 新发布的开源 Nemotron 3 Nano 模型。该模型为 30B 总参数、3.6B 激活参数的混合 Transformer-Mamba MoE 架构,支持 1M 上下文和 thinking budget,权重、数据集与训练配方全开放,提供 BF16、FP8、NVFP4 三种精度。
原文给出 Nemotron 3 Nano 的架构、精度版本和 SGLang 部署命令,读者可据此在自有 GPU 上快速跑通推理。
1 月 28 日更新:NVIDIA 刚刚发布了 NVFP4 精度的 Nemotron 3 Nano 模型。该模型开箱即由 SGLang 支持,它采用一种名为量化感知蒸馏(QAD)的新方法,在 NVFP4 上保持精度,同时在 B200 上相比 FP8-H100 提供 4 倍吞吐量。你可以在此下载 NVFP4 检查点,并使用这个 NVIDIA Brev 可启动项运行它们。
我们很高兴地宣布,SGLang 在 Day 0 就支持最新的高效 NVIDIA Nemotron 3 Nano 模型!
Nemotron 3 Nano 是新发布的开放 Nemotron 3 系列的一部分,它是一个紧凑的 MoE 语言模型,提供业界领先的计算效率和精度,使开发者能够构建专门的智能体 AI 系统。
Nemotron 3 Nano 完全开放,提供开放权重、数据集和配方,因此开发者可以轻松地在其基础设施上自定义、优化和部署该模型,以实现最大程度的隐私和安全。下图显示,Nemotron 3 Nano 在 Artificial Analysis 开放性 vs 智能指数中处于最具吸引力的象限。

NVIDIA Nemotron 3 为开源 AI 树立新标准
TL;DR
- Architecture:
- 采用混合 Transformer-Mamba 架构的专家混合(MoE)
- 支持 Thinking Budget,以最小推理 token 生成提供最佳精度
- Accuracy
- 在编码、科学推理、数学和指令遵循方面领先的精度
- 模型规模:30B,激活参数 3.6B
- 上下文长度:1M
- 模型输入:文本
- 模型输出:文本
- 支持的 GPU:NVIDIA RTX Pro 6000、DGX Spark、H100、B200。
- Get started:
- 从 Hugging Face 下载模型权重 - BF16、FP8、NVFP4
- 使用 SGLang 进行推理
- 技术报告,以使用 Nemotron 技术构建自定义、优化的模型。
安装和快速开始
如需更轻松地设置 SGLang,请参阅我们的入门 cookbook,可在此处获取,或通过 NVIDIA Brev 可启动项获取。
运行以下命令以安装依赖项:
uv pip install sglang==0.5.6.post3.dev1278+gad1b4e472 --extra-index-url https://sgl-project.github.io/whl/nightly/
然后我们可以提供此模型:
# BF16
python3 -m sglang.launch_server --model-path nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-BF16 --trust-remote-code --reasoning-parser nano_v3 --tool-call-parser qwen3_coder
# FP8
python3 -m sglang.launch_server --model-path nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-FP8 --trust-remote-code --reasoning-parser nano_v3 --tool-call-parser qwen3_coder
# NVFP4
python3 -m sglang.launch_server --model-path nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-NVFP4 --trust-remote-code --reasoning-parser nano_v3 --tool-call-parser qwen3_coder
服务器启动并运行后,你可以使用以下代码片段向模型发出提示:
from openai import OpenAI
# The model name we used when launching the server.
SERVED_MODEL_NAME = "nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-BF16"
BASE_URL = f"http://localhost:30000/v1"
API_KEY = "EMPTY" # SGLang server doesn't require an API key by default
client = OpenAI(base_url=BASE_URL, api_key=API_KEY)
resp = client.chat.completions.create(
model=SERVED_MODEL_NAME,
messages=[
{"role": "system", "content": "You are a helpful AI assistant."},
{"role": "user", "content": "Give me 3 bullet points about SGLang."}
],
temperature=0.6,
max_tokens=512,
)
print(resp.choices[0].message.reasoning_content, resp.choices[0].message.content)
Nemotron 3 Nano 以领先的精度提供最高效率,用于构建 AI 智能体
Nemotron 3 Nano 基于混合 Mamba-Transformer 架构,将标准前馈网络(FFN)层替换为 MoE 层,并将大部分注意力层替换为 Mamba-2。这实现了更高的精度,同时仅使用一小部分激活参数。通过利用 MoE,Nemotron 3 Nano 降低了计算需求,并满足实际部署所需的严格延迟约束。
Nemotron 3 Nano 的混合 Mamba-Transformer 架构将 token 吞吐量提升高达 4 倍,使模型能够更快地推理,同时提供更高的精度。其“thinking budget”功能有助于避免不必要的计算,减少过度思考,并确保更低、更可预测的推理成本。

Nemotron 3 Nano 在开放推理模型中提供更高吞吐量和领先精度
Nemotron 3 Nano 基于 NVIDIA 精选的高质量数据训练,在 SWE Bench Verified、GPQA Diamond、AIME 2025、Arena Hard v2 和 IFBench 等基准测试中领先,在编码、推理、数学和指令遵循方面提供顶级精度。这使其成为为各种企业用例(包括金融、网络安全、软件开发和零售)构建 AI 智能体的理想选择。

Nemotron 3 Nano 在多个热门学术基准上,于开源小型推理模型中提供了领先的准确率。
开始使用
- 从 Hugging Face 下载 Nemotron 3 Nano 模型权重 - BF16、FP8、NVFP4
- 使用此cookbook 通过 SGLang 进行推理,或通过此 NVIDIA Brev launchable 运行。
延伸阅读
- 分享你的想法并对重要事项投票,帮助塑造 Nemotron 的未来。
- 订阅 NVIDIA 新闻并在 LinkedIn、X、YouTube 以及 Discord 上的 Nemotron 频道关注 NVIDIA AI,及时了解 NVIDIA Nemotron 的最新动态。
致谢
我们感谢所有贡献者在开发和将 Nemotron V3 Nano 集成到 SGLang 中所付出的努力。
Nvidia 团队:Roi Koren、Max Xu、Netanel Haber、Tomer Bar Natan、Daniel Afrimi、Nirmal Kumar Juluru、Ann Guan 以及更多人
SGLang 团队与社区:Baizhou Zhang、Jiajun Li、Ke Bao、Mingyi Lu、Richard Chen
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org