跳到正文
原文
LMSYS:Blog(Chatbot Arena 团队)·· 2 小时前精选AI 评分68

SGLang Day-0 支持 NVIDIA 开源混合 MoE 模型 Nemotron 3 Nano

News SGLang Adds Day-0 Support for the Highly Efficient, Open Nemotron 3 Nano Hybrid MoE Model Jan 28th Update: NVIDIA just released their Nemotron 3 Nano model in NVFP4 precision. This model is supported by SGLang out of the box and it uses a new method called Quantization-Aware Distillation (... NVIDIA Nemotron Team December 15, 2025

AI 导读

SGLang 宣布 Day-0 支持 NVIDIA 新发布的开源 Nemotron 3 Nano 模型。该模型为 30B 总参数、3.6B 激活参数的混合 Transformer-Mamba MoE 架构,支持 1M 上下文和 thinking budget,权重、数据集与训练配方全开放,提供 BF16、FP8、NVFP4 三种精度。

推荐理由

原文给出 Nemotron 3 Nano 的架构、精度版本和 SGLang 部署命令,读者可据此在自有 GPU 上快速跑通推理。

正文 · AI 翻译

1 月 28 日更新:NVIDIA 刚刚发布了 NVFP4 精度的 Nemotron 3 Nano 模型。该模型开箱即由 SGLang 支持,它采用一种名为量化感知蒸馏(QAD)的新方法,在 NVFP4 上保持精度,同时在 B200 上相比 FP8-H100 提供 4 倍吞吐量。你可以在此下载 NVFP4 检查点,并使用这个 NVIDIA Brev 可启动项运行它们。

我们很高兴地宣布,SGLang 在 Day 0 就支持最新的高效 NVIDIA Nemotron 3 Nano 模型!

Nemotron 3 Nano 是新发布的开放 Nemotron 3 系列的一部分,它是一个紧凑的 MoE 语言模型,提供业界领先的计算效率和精度,使开发者能够构建专门的智能体 AI 系统。

Nemotron 3 Nano 完全开放,提供开放权重、数据集和配方,因此开发者可以轻松地在其基础设施上自定义、优化和部署该模型,以实现最大程度的隐私和安全。下图显示,Nemotron 3 Nano 在 Artificial Analysis 开放性 vs 智能指数中处于最具吸引力的象限。

figure1

NVIDIA Nemotron 3 为开源 AI 树立新标准

TL;DR

  • Architecture:
    • 采用混合 Transformer-Mamba 架构的专家混合(MoE)
    • 支持 Thinking Budget,以最小推理 token 生成提供最佳精度
  • Accuracy
    • 在编码、科学推理、数学和指令遵循方面领先的精度
  • 模型规模:30B,激活参数 3.6B
  • 上下文长度:1M
  • 模型输入:文本
  • 模型输出:文本
  • 支持的 GPU:NVIDIA RTX Pro 6000、DGX Spark、H100、B200。
  • Get started:

安装和快速开始

如需更轻松地设置 SGLang,请参阅我们的入门 cookbook,可在此处获取,或通过 NVIDIA Brev 可启动项获取。

运行以下命令以安装依赖项:

uv pip install sglang==0.5.6.post3.dev1278+gad1b4e472 --extra-index-url https://sgl-project.github.io/whl/nightly/

然后我们可以提供此模型:

# BF16
python3 -m sglang.launch_server --model-path nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-BF16 --trust-remote-code --reasoning-parser nano_v3 --tool-call-parser qwen3_coder

# FP8
python3 -m sglang.launch_server --model-path nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-FP8 --trust-remote-code --reasoning-parser nano_v3 --tool-call-parser qwen3_coder

# NVFP4
python3 -m sglang.launch_server --model-path nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-NVFP4 --trust-remote-code --reasoning-parser nano_v3 --tool-call-parser qwen3_coder

服务器启动并运行后,你可以使用以下代码片段向模型发出提示:

from openai import OpenAI

# The model name we used when launching the server.
SERVED_MODEL_NAME = "nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-BF16"

BASE_URL = f"http://localhost:30000/v1"
API_KEY = "EMPTY"  # SGLang server doesn't require an API key by default

client = OpenAI(base_url=BASE_URL, api_key=API_KEY)

resp = client.chat.completions.create(
    model=SERVED_MODEL_NAME,
    messages=[
        {"role": "system", "content": "You are a helpful AI assistant."},
        {"role": "user", "content": "Give me 3 bullet points about SGLang."}
    ],
    temperature=0.6,
    max_tokens=512,
)
print(resp.choices[0].message.reasoning_content, resp.choices[0].message.content)

Nemotron 3 Nano 以领先的精度提供最高效率,用于构建 AI 智能体

Nemotron 3 Nano 基于混合 Mamba-Transformer 架构,将标准前馈网络(FFN)层替换为 MoE 层,并将大部分注意力层替换为 Mamba-2。这实现了更高的精度,同时仅使用一小部分激活参数。通过利用 MoE,Nemotron 3 Nano 降低了计算需求,并满足实际部署所需的严格延迟约束。

Nemotron 3 Nano 的混合 Mamba-Transformer 架构将 token 吞吐量提升高达 4 倍,使模型能够更快地推理,同时提供更高的精度。其“thinking budget”功能有助于避免不必要的计算,减少过度思考,并确保更低、更可预测的推理成本。

figure1

Nemotron 3 Nano 在开放推理模型中提供更高吞吐量和领先精度

Nemotron 3 Nano 基于 NVIDIA 精选的高质量数据训练,在 SWE Bench Verified、GPQA Diamond、AIME 2025、Arena Hard v2 和 IFBench 等基准测试中领先,在编码、推理、数学和指令遵循方面提供顶级精度。这使其成为为各种企业用例(包括金融、网络安全、软件开发和零售)构建 AI 智能体的理想选择。

figure1

Nemotron 3 Nano 在多个热门学术基准上,于开源小型推理模型中提供了领先的准确率。

开始使用

  • 从 Hugging Face 下载 Nemotron 3 Nano 模型权重 - BF16、FP8、NVFP4
  • 使用此cookbook 通过 SGLang 进行推理,或通过此 NVIDIA Brev launchable 运行。

延伸阅读

致谢

我们感谢所有贡献者在开发和将 Nemotron V3 Nano 集成到 SGLang 中所付出的努力。

Nvidia 团队:Roi Koren、Max Xu、Netanel Haber、Tomer Bar Natan、Daniel Afrimi、Nirmal Kumar Juluru、Ann Guan 以及更多人

SGLang 团队与社区:Baizhou Zhang、Jiajun Li、Ke Bao、Mingyi Lu、Richard Chen

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org