OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning:面向高频智能体执行的 30B-A3B 开源模型
What Is Nemotron 3.5 Lightning
OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,一个 30B 总参数、每 token 激活约 3B 的 MoE 开源模型,定位为智能体高频执行步骤(工具调用、编码、指令遵循),与面向复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成互补。
原文梳理了 Lightning 与 Ultra 在智能体工作流中的分工、价格和上下文差异,并给出可迁移的双模型路由思路。
一个智能体可能会为规划一项任务而进行一次困难的调用,并为了执行该任务而进行数十次调用。后续的这些调用会读取文件、选择工具、验证结果,并决定下一步该做什么。NVIDIA 构建 Nemotron 3.5 Lightning 正是为了应对工作流中这一高频部分。
Nemotron 3.5 Lightning 是一个拥有 300 亿参数的混合专家模型,每个 token 激活约 30 亿参数。它支持工具调用、编码任务、指令遵循以及其他范围明确的智能体步骤。
这个名字很容易与 Nemotron 3 Ultra 混淆,但这两个模型是为智能体工作流的不同部分而构建的。在它们之间进行选择会影响整个运行过程的成本、延迟和可靠性。
Nemotron 3.5 Lightning 概览
| 规格 | Nemotron 3.5 Lightning |
|---|---|
| 模型类型 | 混合 Mamba-2、注意力与混合专家语言模型 |
| 模型规模 | 总计 300 亿参数,激活 30 亿 |
| 输入与输出 | 文本到文本 |
| 模型上下文限制 | 根据 NVIDIA 的模型卡,最高可达 100 万 token |
| OpenRouter 标准模型 | 所有当前提供商均为 262,144 token 上下文。补全限制因提供商而异,从 32,768 到 235,929 token 不等 |
| OpenRouter 免费模型 | 1,000,000 token 上下文,最高 65,536 补全 token |
| 工具调用 | 两个模型均已列出。当前四家标准提供商中有两家列出 |
| 结构化输出 | 标准模型在当前四家提供商中均已列出。免费模型未列出 |
| OpenRouter 模型 ID | nvidia/nemotron-3.5-lightning 和 nvidia/nemotron-3.5-lightning:free |
| 权重 | BF16 参考权重,以及优化的 NVFP4 和 GGUF 版本 |
| 许可证 | OpenMDW-1.1 |
| 发布日期 | 2026 年 8 月 11 日 |
此表中的端点限制和功能来自我们 2026 年 9 月 11 日的模型页面。在设计具体限制之前,请查看标准模型页面或免费模型页面。
30B MoE 且激活 30 亿参数是什么意思?
Nemotron 3.5 Lightning 是一个稀疏混合专家模型。它总共包含 300 亿参数,但并非每个 token 都会使用所有专家。当模型处理每个 token 时,路由器会选择较小的专家子集,这使得激活参数数量约为 30 亿。你也会看到它被写作 30B-A3B,意思是总计 300 亿参数,约 30 亿激活参数。
这种设计使模型比 3B 稠密模型拥有更大的总容量,同时无需为每个 token 运行全部 300 亿参数。这就是 Lightning 如何将相对较大的检查点与频繁智能体调用所需吞吐量结合起来的方式。
激活数量并不是完整的计算或内存规格。完整模型仍然需要存储,共享层在推理期间也会运行。硬件需求取决于精度、上下文长度、推理引擎、批处理策略和缓存配置。
Lightning 还采用了混合架构,而非纯 Transformer 堆栈。NVIDIA 模型卡描述了交错的 Mamba-2 和 MoE 层以及选定的注意力层。它还支持可配置推理,并附带多 token 预测和两个推测解码草稿模型 DSpark 和 DFlash,以实现更快的生成,以及一个针对推理调优的 NVFP4 检查点。
Nemotron 3.5 Lightning 是为哪些场景设计的?
长时间运行的智能体会进行大量模型调用。有些调用需要困难的规划。大部分工作则更为狭窄,例如选择工具、生成参数、检查结果、编辑文件或决定下一步该做什么。
NVIDIA 将 Lightning 定位在这一执行层。当你的工作负载具有以下特征时,该模型就是一个候选方案:
- 智能体进行大量调用,延迟或成本会在整个运行过程中不断累积。
- 每次调用都有明确的目标和足够的上下文来完成它。
- 模型需要使用工具、遵循指令或返回结构化数据。
- 你希望获得开放权重,以便针对某个领域或部署目标进行定制。
例如,一个编码智能体可以使用更大的推理模型来检查代码仓库并确定实现方案。然后 Lightning 可以处理各个步骤,例如定位符号、编辑一个文件、运行工具并解释结果。
Nemotron 3.5 Lightning 与 Nemotron 3 Ultra 对比
NVIDIA 从 Nemotron 3 Ultra 中蒸馏出 Lightning,但这两个模型并不能互换使用。Lightning 是较小的模型,用于高吞吐量的智能体执行。Ultra 是较大的模型,用于复杂推理和编排。
| Nemotron 3.5 Lightning | Nemotron 3 Ultra | |
|---|---|---|
| OpenRouter 模型 ID | nvidia/nemotron-3.5-lightning | nvidia/nemotron-3-ultra-550b-a55b |
| 总参数量 | 30B | 550B |
| 激活参数量 | 3B | 55B |
| 主要角色 | 高吞吐量执行和专门任务 | 复杂推理和编排 |
| OpenRouter 上的上下文 | 所有当前提供商均为 262,144 tokens | 202,800 至 262,144 tokens,取决于提供商 |
| 工具调用 | 在四个当前提供商中的两个上列出 | 在所有当前提供商上列出 |
| 结构化输出 | 在所有当前提供商上列出 | 在四个当前提供商中的一个上列出 |
| 2026 年 9 月 11 日的提供商价格 | 输入 $0.065 至 $0.10/M,输出 $0.18 至 $0.25/M | 输入 $0.50 至 $0.625/M,输出 $2.20 至 $3.125/M |
NVIDIA 报告称,Lightning 的吞吐量最高可达同等规模开源模型的四倍。在 NVIDIA 的 PinchBench 测试中,它在准确率相当的情况下完成 10,000 个智能体任务的速度最高快 30%。这些是供应商报告的结果,因此请在你自己的工作负载上测试吞吐量和任务完成情况。
区别在于调用的难度和后果。当某个步骤需要对模糊问题进行深度推理、为长工作流制定计划,或做出难以逆转的决策时,Ultra 更合适。当任务范围明确且重复频率足够高,以至于延迟和成本变得重要时,Lightning 更合适。
你不需要为整个智能体只分配一个模型。将复杂调用路由到 Ultra,将频繁的执行调用路由到 Lightning。然后衡量这种组合是否在不降低可靠性的情况下改善了每个已完成任务的成本。

在 OpenRouter 上在两个模型之间路由
如果你更愿意把模型选择交给我们,请使用 Auto Router。将 openrouter/auto 作为模型 ID 发送,Auto Router 会根据任务类型、模型能力、工具支持和成本对提示进行分类,然后选择模型。cost_tier 设置用于选择成本区间,从 low 到 max。它不会将对话从较便宜的模型升级到较昂贵的模型。如果你希望 Auto Router 只在 Lightning 和 Ultra 之间选择,请用 allowed_models 限制其选择范围。
在 OpenRouter 之外在两个模型之间路由
NVIDIA 的 NeMo Switchyard 将这种路由模式实现为一个开源编排层。其升级路由器会以成本较低的模型开始每段对话,当 LLM 评判器检测到持续困难时,会将会话转移到能力更强的模型。在 LangChain 的评估中,针对 145 个多步骤智能体任务,在 Lightning 和 Claude Opus 4.8 之间进行路由,与仅使用前沿模型的基线相比,成本降低了 74%,同时约 7% 的调用被发送到前沿模型。准确率大约低了六个百分点。这一结果展示了该基准测试上的路由权衡。它并不是对 Lightning 与 Ultra 组合的基准测试。在依赖这些节省之前,请先在你自己的任务上测试任何路由设置。
上下文窗口有多长?
Nemotron 3.5 Lightning 在模型层面支持最多 100 万个 token。你的应用程序可用的上下文取决于为其提供服务的端点。
2026 年 9 月 11 日,标准模型 ID 背后的每个提供商都提供 262,144 个 token 的上下文窗口。补全限制因提供商而异,从 32,768 到 235,929 个 token 不等。:free 模型提供完整的 100 万 token 上下文窗口,并将补全上限设为 65,536 个 token。
如果请求需要超过 262,144 个 token,目前在 OpenRouter 上只有免费端点提供该模型完整的 100 万 token 上下文。NVIDIA 在该端点上的通知指出,使用情况会被记录,用于安全目的以及改进 NVIDIA 产品和服务,并要求你不要上传机密信息或个人数据。对于敏感或生产环境的长上下文工作负载,请选择其他端点或模型。
当你在两个模型 ID 之间切换时,这一差异很重要。在免费端点上成功的请求可能会超出标准端点的上下文限制。免费端点还列出了工具调用,但没有列出 response_format 或结构化输出。
请查看模型页面,而不是将架构的最大上下文视为每个提供商的承诺。我们在模型页面上展示每个端点的当前限制和支持的参数。
开放权重与本地部署
NVIDIA 根据 OpenMDW-1.1 许可证发布了 BF16 参考检查点。模型卡将 BF16 版本描述为后训练、领域适配、研究以及生成优化变体的起点。NVIDIA 还发布了用于定制和评估的训练数据与配方,模型卡称该版本已准备好用于商业用途。
对于直接推理,NVIDIA 推荐其 NVFP4 版本。它还为受支持的本地系统提供了 GGUF 检查点。BF16 指南列出了单 GPU 部署需要 H100 80GB 或 A100 80GB。优化版本面向 RTX 5090、RTX PRO 6000 和 DGX Spark 等硬件。
在本地运行模型并不意味着每台机器都能提供完整的 100 万 token 上下文窗口。在 NVIDIA 当前的 Ollama 指南中,默认上下文随可用 VRAM 扩展。低于 24GB 时为 4K,24GB 到低于 48GB 时为 32K,48GB 或以上时为 256K。llama.cpp 示例使用约 40K。你可以提高这些限制,但这样做可能需要更多内存或 CPU 卸载。
权重是公开可用的,“开放权重”是最清晰的描述。在重新分发修改后的模型或根据其条款做出部署决策之前,请阅读 OpenMDW-1.1 许可证。
如何在 OpenRouter 上调用 Nemotron 3.5 Lightning
如果你不想配置 GPU 或管理推理引擎,可以通过 OpenRouter 调用 Lightning。标准模型 ID 保持相同的 API,同时我们会将请求路由到该模型可用的各个提供商。
安装 OpenRouter TypeScript SDK。
npm install @openrouter/sdk在环境中设置 OPENROUTER_API_KEY,然后使用 Lightning 模型 ID 发送请求。标准模型列出了结构化输出,因此你可以要求返回 JSON schema,并让响应符合该 schema。
import { OpenRouter } from "@openrouter/sdk";
const openRouter = new OpenRouter({
apiKey: process.env.OPENROUTER_API_KEY,
});
const result = await openRouter.chat.send({
chatRequest: {
model: "nvidia/nemotron-3.5-lightning",
messages: [
{
role: "user",
content:
'Ticket: "Checkout returns a 500 after I click Pay. Started this morning, three customers affected." Return its category and priority.',
},
],
responseFormat: {
type: "json_schema",
jsonSchema: {
name: "triage",
strict: true,
schema: {
type: "object",
properties: {
category: { type: "string" },
priority: { type: "string", enum: ["low", "medium", "high"] },
},
required: ["category", "priority"],
additionalProperties: false,
},
},
},
provider: {
requireParameters: true,
},
},
});
if (!("choices" in result)) {
throw new Error("Expected a non-streaming response");
}
console.log(result.choices[0]?.message.content);当我们在 2026 年 9 月 11 日运行此请求时,模型返回了 {"category": "Bug (Payment Checkout)", "priority": "medium"}。每次运行的采样输出会有所不同,请求保证的是 schema,而不是具体的值。
同一模型内,不同提供商对 response_format 和结构化输出的支持有所不同。默认情况下,我们优先选择支持你发送的 tools 和 response_format 参数的提供商,而不支持某个参数的提供商会忽略该参数。如示例所示,将 require_parameters 设为 true 会将请求限制为支持其中每个参数的提供商。完整行为请参阅提供商路由文档。
要试用免费端点,请将模型 ID 改为 nvidia/nemotron-3.5-lightning:free。免费端点不列出 response_format,因此在那里去掉该字段,并自行验证 JSON。它适用于评估和小规模实验,其限制和可用性与标准端点不同。
不要通过免费端点提交机密信息或个人数据。其模型页面载有 NVIDIA 的声明,说明使用情况会被记录,用于安全目的以及改进 NVIDIA 产品和服务。在决定发送哪些提示词之前,请先阅读该声明。
默认情况下,我们会按价格对标准模型在其提供商之间进行负载均衡。有两种变体会改变该排序。nvidia/nemotron-3.5-lightning:nitro 按吞吐量对提供商排序,nvidia/nemotron-3.5-lightning:exacto 优先选择具有更强工具调用质量信号的提供商。对于为延迟和工具使用而选择的模型,Nitro 和 Exacto 是值得了解的两个变体。
Lightning 接受 tools 和 tool_choice,因此你也可以在智能体循环中使用它。完整的请求、工具执行和迭代流程请参阅我们的工具调用智能体循环指南。
你应该使用 Nemotron 3.5 Lightning 吗?
当你需要一个快速、开放权重的模型来执行频繁且定义明确的智能体步骤时,Nemotron 3.5 Lightning 值得评估。其 30B-A3B 架构、工具支持以及较低的标价使其成为智能体的候选执行模型,否则这些智能体会将每次调用都发送给大得多的推理模型。
将模型名称作为起点,而不是决定。根据你的智能体执行的工具调用和任务构建评估集。衡量整个运行过程中的任务成功率、重试次数、延迟和总成本。如果智能体重复调用或频繁升级结果,以至于抵消了节省,那么更便宜的调用也无济于事。
从 nvidia/nemotron-3.5-lightning 开始,或使用 nvidia/nemotron-3.5-lightning:free 在引入付费流量之前测试该模型。
常见问题
什么是 Nemotron 3.5 Lightning?
Nemotron 3.5 Lightning 是 NVIDIA 的开放权重 30B 混合专家语言模型,每个 token 约有 3B 活跃参数。NVIDIA 将其定位用于高容量智能体执行、工具使用、编码、指令遵循和专门任务。
Nemotron 3.5 Lightning 与 Nemotron 3 Ultra 相同吗?
不同。Nemotron 3.5 Lightning 总参数为 30B,活跃参数为 3B。Nemotron 3 Ultra 总参数为 550B,活跃参数为 55B。Lightning 面向频繁的执行步骤。Ultra 面向复杂推理和编排。
30B-A3B 是什么意思?
30B-A3B 表示该模型总共有 300 亿参数,每个 token 激活约 30 亿参数。混合专家路由器会为每个 token 选择模型专家中的一个子集,而不是运行所有专家。
Nemotron 3.5 Lightning 是否支持工具调用和结构化输出?
标准 OpenRouter 模型 nvidia/nemotron-3.5-lightning 在其支持的参数中列出了 tools、tool_choice、response_format 和结构化输出。支持情况因提供商而异,因此如果你的请求依赖于其中某一项,请将 require_parameters 设置为 true。免费模型列出了 tools 和 tool_choice,但没有列出 response_format 或结构化输出。
有免费的 Nemotron 3.5 Lightning API 吗?
有。我们列出了 nvidia/nemotron-3.5-lightning:free,由 NVIDIA 提供,不收取 token 费用。免费模型的速率限制和可用性与付费模型不同,并且此端点带有 NVIDIA 数据声明。请勿通过它发送机密信息或个人数据。
我可以在本地运行 Nemotron 3.5 Lightning 吗?
可以。NVIDIA 根据 OpenMDW-1.1 许可证发布了 BF16、NVFP4 和 GGUF 权重。BF16 参考检查点面向单块 80GB H100 或 A100。NVFP4 和 GGUF 版本面向受支持的本地硬件,例如 RTX 5090、RTX PRO 6000 和 DGX Spark。在选择部署方案之前,请查看 NVIDIA 当前的模型卡和许可证。
来源:OpenRouter:Announcements(RSS) · openrouter.ai