OpenRouter 评出 2026 年 6 月最值得关注的四款开源权重模型
The Open Weight Models that Matter: June 2026
OpenRouter 认为 2026 年 6 月最值得关注的四款开源权重模型是 DeepSeek V4 Flash、GLM 5.2、MiniMax M3 和 NVIDIA Nemotron 3 Ultra,并指出开源模型与闭源前沿的差距已连续 18 个月稳定在 3-6 个月。
OpenRouter 基于自家价格与流量数据梳理四款关键开源权重模型的定位与取舍,读者可按成本、质量和模态直接对照选型。
过去几个月里,一批引人注目的开放权重模型相继发布,其中包括来自中国和美国的新玩家。此外,随着成本成为大规模使用 AI 的组织的核心关注点,开放权重模型正迎来高光时刻。与许多人的预期相反,开放权重模型的智能和能力正在跟上美国前沿实验室,并且在超过 18 个月的时间里一直保持着 3-6 个月的稳定差距。前沿实验室(至少目前)似乎并没有加速甩开开放权重实验室。
将工作负载从前沿模型迁移到开放权重模型,存在巨大的成本节约机会。前沿不可避免地会继续前进,但对于任何固定的智能水平,成本都会持续下降。
在发布节奏、参差不齐的能力前沿以及新进入者之间,很难知道你可能想关注哪些模型,以及为什么。截至 2026 年 6 月,我们认为以下四个开放权重模型最为重要。
1. DeepSeek V4 Flash — 首个跨越智能体卢比孔河的模型
DeepSeek V4 Flash 是首个被团队立即投入真实智能体流水线、作为 Anthropic 或 OpenAI 级别前沿模型的可信替代品的开放权重模型。更大的 V4 Pro 变体以 SWE-bench Verified 上 80.6% 的得分设定了上限,这是开放权重模型的最高分,与 GPT-5.5 级别的智能体性能相当。但真正实现突破的是 Flash,因为它以处于性能和成本帕累托前沿的价格,捕捉到了大部分这种能力。
数据支持了这一行为。Flash 采用 MIT 许可证,是一个约 284B 参数 / 约 13B 激活的 MoE 模型,具有 1M token 上下文,在 SWE-bench Verified 上达到 79.0%——与 Pro 的 80.6% 及其自身的约 1.6T / 49B 同门兄弟相差约 1.6 个百分点。该模型于 2026 年 4 月发布。
采用率在很大程度上也由价格驱动;DeepSeek 的第一方 API 将 Flash 定价为每百万 token 0.14 美元 / 0.28 美元(输入/输出),但确实会保留数据用于训练目的。通过缓存,实际价格甚至更低(每百万输入 token 0.029 美元)。DeepSeek 以这一定价推出该模型,并将其宣传为 75% 的“折扣”,并在 5 月将该定价永久化。这大约比 GPT-5.5 的输出成本便宜 150 倍。然而,DeepSeek 会保留你的数据并用于训练。
不利用数据进行训练的西方托管商(例如 Fireworks、Together、DeepInfra)收费约为第一方价格的两倍。对于这样的智能水平来说,仍然极具价值。我们不知道训练数据的价值在多大程度上使得 DeepSeek 能够维持低定价,还是说这是算力补贴等原因——但可以肯定的是,低第一方价格已经为所有提供商创造了竞争动态,从而为这一智能水平带来了极低的价格。
OpenRouter 在模型页面的提供商标签页的详细信息窗格中展示了每个提供商的原产国,并允许细粒度控制哪些数据政策对你和你的组织是可接受的。
注意事项:仅支持文本;不支持图像或视频输入。第一方 API 将数据路由经中国,其服务条款允许使用你的数据进行训练——不过如前所述,也有价格相当的不训练数据的西方托管方。据经验,该模型更偏向技术类工作,在写作和语气方面满意度较低。我们还看到有报告称,与 Anthropic 模型相比,提示词需要更精细——Flash 在给出非常具体的指令时比依赖自身判断表现更好。
适用场景:你想要一个前沿级别的智能体/编程模型,而成本只是其零头。从 Flash 开始;只有当边际质量值得溢价时,再升级到 Pro。
2. GLM 5.2 —— 让 Opus 式智能体编程变得可移植的开源模型
GLM 5.2 于 6 月中旬发布,但早期评价非常强劲。DeepSeek 在价格上取得突破,而 GLM 5.2 似乎在规划质量和长时程编程上取得突破。
Artificial Analysis 将 GLM 5.2 列为其智能指数(v4.1)上排名第一的开源权重模型,得分为 51,领先于 Nemotron 3 Ultra(48)、MiniMax M3(44)、DeepSeek V4 Pro(44)和 Kimi K2.6(43),仅比 Claude Fable 5 低约 5 分。它在 Artificial Analysis 的真实世界智能体基准(GDPval-AA v2)上领先开源权重模型,实际上与 GPT-5.5 xhigh 持平。
采用尚处早期,但该模型已在相当一批第三方托管方上线。价格不像 DeepSeek 那么便宜,但仍显著低于闭源前沿编程模型。实际价格为 OpenRouter 加权平均 每百万 token 0.447 美元 / 3.31 美元(输入/输出)。虽然按每 token 计算比 GPT-5.5 / Opus 级模型便宜,但该模型倾向于大量思考,输出 token 可能迅速烧钱。
还有地缘政治的顺风。GLM 5.2 在美国出口管制指令发布几天后落地,该指令迫使 Anthropic 广泛禁用 Fable 5 和 Mythos 5,以防止外国国民访问。对于要求连续性的组织来说,一个具有接近前沿编程性能的 MIT 权重模型如今更具吸引力。
注意事项:仅支持文本;不支持图像或视频输入。它很耗 token,在高思考模型上可能烧钱。它仍然非常新,提供商质量会参差不齐。各提供商的吞吐量最高约为 ~78 tok/s(相比之下 DeepSeek V4-Flash 约为 ~84 tok/s)。
适用场景:作为智能体规划和编程最接近的即插即用替代品。擅长架构规划、仓库级重构或长时间运行的智能体任务。当质量和规划比极低价格更重要时,选择它而非 DeepSeek。
3. MiniMax M3 —— 多模态长上下文模型
MiniMax M3 是该组中唯一不仅能理解文本,还能原生理解图像和视频的模型。如果你的智能体需要读取截图、检查 UI 状态、解析图表或对视频进行推理,M3 是应首先测试的开源权重路线。
Artificial Analysis 将 M3 列在其智能指数(v4.1)上得分为 44——与 DeepSeek V4 Pro 持平,落后于 GLM 5.2 和 Nemotron 3 Ultra,但其差异化在于模态,而非原始指数排名。更能说明问题的是,它在 GDPval-AA(Artificial Analysis 的真实世界智能体基准)上大致与 Claude Sonnet 4.6 持平。它也是一个真正的长上下文模型:约 428B 参数 / 约 23B 激活 MoE,1M token 上下文,以及 MiniMax 稀疏注意力,使百万 token 推理不那么离谱。
实际定价颇具吸引力,在 OpenRouter 上的加权平均为每百万 token 输入 $0.098 / 输出 $1.21(不过当上下文长度超过 512k token 时价格会上涨)。但和 GLM 一样,便宜的 token 并不意味着便宜的运行成本。M3 可能输出冗长,且推理负担较重。
其架构同样具有创新性;MSA 在真实的 K/V 块上使用分块稀疏注意力,而非单独的检索或压缩系统。论文报告称在质量没有重大损失的情况下大幅减少了注意力计算量。在实践中,这正是 M3 能够以合理成本支持整仓库、长文档、大量截图或视频接地的智能体的原因。
注意事项:并非 MIT 许可。权重已公开,但采用 MiniMax 社区许可证:商业使用需要署名/声明,较大的商业产品需要事先获得书面授权。提供商质量和完整上下文支持会有所不同。它也不是该组中最好的纯编码模型;对于纯文本的智能体编码,GLM 5.2 可能是更好的默认选择。
适用场景:当你需要具有原生图像或视频输入的长上下文智能体时。最适合 UI 自动化、截图转代码、图表/文档理解、视频接地工作流或混合模态的仓库/文档智能体。它很可能是 Gemini Flash 系列模型的有力竞争者,后者同样擅长多模态理解。
4. NVIDIA Nemotron 3 Ultra —— 美国开放权重加速器
NVIDIA 的 Nemotron 3 Ultra 是最明确的信号,表明强大的开放权重模型并非只来自中国实验室。它并非整体上最强的开放模型,但它是美国最强的开放权重参赛者:一个严肃的推理模型,为企业部署而构建,背后有 NVIDIA 的硬件和软件栈支持。
基准测试表现扎实。Artificial Analysis 在其智能指数(v4.1)上给 Nemotron 3 Ultra 打分为 48——在开放权重模型中排名第二,仅次于 GLM 5.2(51),领先于 MiniMax M3、DeepSeek V4 Pro 和 Kimi K2.6,并且轻松成为美国最强的开放权重参赛者。其差异化在于部署效率。OpenRouter 的加权平均价格为每百万 token 输入 $0.423 / 输出 $2.61,另有一条:free路线,被证明极受欢迎并推动了采用。
该模型是一个 550B / 55B 激活的混合 Mamba-2 + Transformer MoE,使用 NVFP4 训练,具有 1M 上下文、多 token 预测和 OpenMDW 许可证。NVIDIA 还发布了不止权重:数据、配方、评估工具和 RL 基础设施。NVIDIA 的动机很明确:更多的开放模型使用(以及更广泛的有意义模型)意味着对 Blackwell/Hopper 推理、NIM 微服务、CUDA、AI Enterprise 和主权 AI 部署的更多需求。Nemotron 是一个模型,但它也旨在推动整个开放生态系统,从而推动 NVIDIA AI 栈。
请关注 NVIDIA 在此的工作,因为他们有动力继续在全球生态系统中扩散模型,并且拥有雄厚的资金来资助研究和训练,以跟上地球上任何实验室的步伐。
注意事项:仅文本;无图像或视频输入。在原始智能上落后于 GLM 5.2,而更广泛的中国开放前沿在峰值编码分数上领先。免费路线对于测试和采用很有用,但不适合围绕它构建严肃的生产 SLA。
在以下情况选择它:你需要一个美国构建的开放权重模型,用于长时间运行的智能体、RAG、编排、编码支持或企业工作流,且在这些场景中速度、可部署性、数据控制和供应商舒适度比绝对基准排名更重要。追求顶级开放编码质量就选 GLM 或 DeepSeek;当技术栈更重要时,选 Nemotron。
概览
| 模型 | AA 指数(v4.1) | 价格(每百万输入/输出) | 吞吐量 | 在以下情况选择它 |
|---|---|---|---|---|
| DeepSeek V4 Flash | 40 | $0.054 / $0.242 | 约 84 tok/s | 你希望以榜单上最低的成本获得前沿级智能体编码能力——即成本/性能帕累托前沿。 |
| GLM 5.2 | 51(开放模型最高) | $0.447 / $3.31 | 约 78 tok/s | 规划质量和长时程编码比极低价格更重要;最接近 Opus 风格工作的开放替代品。 |
| MiniMax M3 | 44 | $0.098 / $1.21 | 约 59 tok/s | 你的智能体需要在长上下文中原生支持图像或视频输入——截图、UI 状态、图表、文档。 |
| Nemotron 3 Ultra | 48 | $0.423 / $2.61(+ :free) | 约 75 tok/s | 你想要一个美国构建、完全开放、基于 NVIDIA 技术栈的模型,且供应商/部署故事与排名同样重要。 |
贯穿主线:DeepSeek 证明了一个开放模型可以直接成为你的前沿智能体——而且只需几美分。GLM 是新的质量领先者。MiniMax 以低成本占据多模态。NVIDIA 带来了一个完全开放、美国构建的选项,背后有最雄厚的资金支持。与闭源前沿的差距真实存在但很窄,而且并未扩大。选择与你的工作负载相匹配的成本/质量/模态/供应商组合中的那个角落——并且,一如既往,唯一的真实标准是用你自己的任务去测试它。
所有定价和吞吐量数据取自 2026 年 6 月的 OpenRouter.ai(跨供应商加权平均);智能分数来自 2026 年 6 月 25 日索引的 Artificial Analysis Intelligence Index v4.1。模型页面:DeepSeek V4 Flash · GLM 5.2 · MiniMax M3 · Nemotron 3 Ultra。
来源:OpenRouter:Announcements(RSS) · openrouter.ai