跳到正文
Mistral AI:News·· 4 小时前精选AI 评分71

Mistral 发布 Mistral Large 4 公测预览,1 万亿参数开放权重模型月底释出

Introducing Mistral Large 4

AI 导读

Mistral 发布 Mistral Large 4(ML4)公开预览,1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底释出,预览 API 已在 Mistral Studio 开放。

推荐理由

官方公布了参数规模、多项基准成绩和权重开放时间,读者可以据此评估它在开源模型中的位置。

正文 · AI 翻译

Le Chonk 

今天,我们推出 Mistral Large 4 的公开预览版。非正式名称 ML4,非常正式地讲:le Chonk。ML4 将开放权重性能推向新的前沿。你今天就可以在 Mistral Studio 上试用预览版 API。权重将于本月底发布。

前沿性能

ML4 是一个 1 万亿参数的原生多模态模型,拥有 490 亿激活参数。它是我们迄今为止规模最大、能力最强的模型,并且随着我们不断优化,它仍在快速进步。

该模型在编程、智能体工作流和多模态理解方面展现出卓越的性能。它已经达到了与全球最强开源模型相竞争的水平,同时显著超越了美国或欧洲开发的任何开放权重模型。在网络安全、金融和法律等关键企业工作负载上,我们发现它在开放模型中处于最先进水平。在某些领域,例如视觉定位,它更进一步,甚至超越了前沿闭源模型。

我们将在本月底发布权重。在此之前,我们正与网络安全领导者、经过审核的合作伙伴和国家主管部门在真实环境中对该模型进行红队测试,他们将访问同一模型,但审核更宽松、网络能力更强。

* DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 上的分数使用了 Artificial Analysis 在该测试框架公开发布前私下评估的数字,这些结果将在该框架发布后纳入 Artificial Analysis Coding Agent Index。

铸于欧洲。为 AI 主权而建。

ML4 是在 Mistral 位于欧洲的自有数据中心中,使用 3,800 块 NVIDIA Grace Blackwell GPU 从零开始训练的。公开预览版也部署在同一基础设施上。这是我们长期投资基础设施、研究和产品开发的重要里程碑:在关键垂直领域实现最先进的性能,通过开放权重交付,旨在让客户掌控自己的 AI。

这在网络安全领域尤为重要,因为提供商层面的拒绝可能会阻碍合法的漏洞研究和事件响应,而在事件处理过程中失去对某项能力的访问本身就可能成为严重的安全风险。ML4 将顶级的网络能力与开放权重和自部署相结合,使组织既拥有能力,也拥有自主权,能够按照自己的政策开展高级安全工作。

该模型将在全球多个地区提供,包括由 Mistral 端到端运营的欧洲部署,独立于其他数字服务提供商,并受欧洲法律管辖。有趣的是:ML4 训练数据中有很大一部分是多语言的,涵盖 160 多种语言,包括欧盟的所有官方语言。 

我们一直与全球金融、工程、制造、物流、制药、科学、航运、公共部门及其他任务关键型行业的领先企业密切合作来训练 ML4。事实上,该模型使用了我们通过 Mistral Forge 向客户提供的相同训练、定制和 RL 环境。

立即试用

还有更多内容即将到来。在我们努力发布权重的过程中,我们将分享有关模型架构、更多基准测试以及我们后训练方法的更多细节。

该模型还将为新一代专业化和优化的 Mistral 模型奠定基础。同时,我们邀请您试用预览版 API,并在社交媒体上与我们分享您的反馈。

能力深度剖析

网络安全

ML4 是全球最强的网络安全 AI 模型之一。在 Artificial Analysis Cyber Index(一项独立评估 AI 模型在真实软件中发现和修复安全漏洞能力的指标)上,它位列全球前五,并大幅领先于中国以外开发的开源权重模型。在该指数的一项测试中,模型需要复现开源软件中的真实漏洞并加以修补,ML4 得分 82%,为所有模型最高。它还能解决 Cybench 中 93% 的挑战——这是一组取自安全竞赛的 40 道练习题,是开源权重模型报告的最高分之一。

这一最高分反映了一种实际优势。包括 Claude Opus 5.5 和 GPT-6 Astra 在内的多款领先闭源模型在同一测试中得分接近零,因为它们拒绝执行该任务。然而,防御软件往往始于证明漏洞真实存在,而这正是闭源模型的安全过滤器可能阻止的工作。随着威胁行为者越来越多地越狱这些模型以支持进攻性网络活动,这一点变得更加重要:防御者需要能够匹敌这些能力、且不受同样拒绝机制约束的系统。ML4 可以完成这项工作,其能力超越了它被明确训练的范围:在内部测试中,它被证明可用于分析恶意软件、确定漏洞优先级以及编写检测规则。对于需要主权、可审计 AI 进行安全运营的组织,它将能够在私有云或本地部署上运行。

ML4 对比同类模型:高效推理应对多样化复杂挑战
恶意软件逆向工程:解决分布外调查任务

智能体编码

ML4 在软件工程、代码库理解和复杂终端工作流方面表现出色,在 DeepSWE v1.1 上得分 61.7%,在 SWE-Atlas-QnA 上得分 59.4%,在 Terminal-Bench 4 上得分 28.3%。其 Coding Agent Index 综合得分 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。

* DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 的得分采用了 Artificial Analysis 在该测试框架公开发布前私下评估的数字,这些结果将在该框架发布后纳入 Artificial Analysis Coding Agent Index。

我们还与 Surge AI 对编码质量进行了盲测人工评估:专业标注员以 1–5 分制对模型输出进行评分,并隐藏模型身份。ML4 Preview 在五个模型中排名第二(3.74),领先于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40),仅次于 Claude Opus 5(4.22)。

智能体工作流

ML4 可运行通用智能体,在复杂工作流中收集信息、使用工具并产出最终交付物。在 AutomationBench 上——涵盖 Gmail、Google Sheets、Slack 和 Salesforce 等应用的 657 个业务工作流——它得分 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。

在知识工作实际产出的专业交付物方面同样出色:电子表格、幻灯片和 PDF。在评估长周期知识工作的 AA-Briefcase 上,它达到 1,393 Elo,领先于 DeepSeek V4 Pro。

多模态

ML4 是我们模型在理解图像能力上的一次跨越式提升。它能够对复杂文档、图表和自然图像进行强大的推理,并将视觉能力带入工程、制造和地球观测等对感知至关重要的行业。

该模型还能进一步将视觉定位与智能体能力相结合:从检查千兆像素级卫星影像——帮助灾难响应团队在分秒必争时采取行动——到分析工程图纸——不断放大、检查和验证,直到答案准确无误。在上方的演示中,ML4 能对密集的自然场景进行定位,核验技术图纸中的机械零件,从 PDF 中检索证据,并在海量地理空间图像中扫描最难发现的物体。

特别是在视觉定位方面,我们发现 ML4 是我们测试过的最强模型之一,例如在 Dense 200 上超过了 GPT-6-Astra(42% 对 41%)。

科学与数学

ML4 具备强大的科学能力,这源于将 AI 驱动的方法与我们的研究人员在数学、物理和化学方面的专业知识相结合。

它非常擅长面向科学任务的智能体编程,例如数据分析、建模和物理现实模拟,这让研究人员能够专注于问题本身,而不是底层琐事。在基准测试中,ML4 在开放权重模型中于 SciCode-Verified 上达到最先进水平。在实践中,它能够一次性生成完整的 Hartree–Fock 模拟——这是一项由一系列高级例程构成的复杂多步化学任务。

ML4 的数学能力也更强,无论是在形式推理还是应用数学方面。在我们的人工评估中,它比 GLM-5.3 推理得更精确、更有条理,并且能够持续完成长篇、特定领域的应用数学任务,包括与前沿理论物理相关的工作。

这些能力结合在一起,使 ML4 成为贯穿整个技术工作流程的强大研究助手——从最初的问题到最终的结果。

SciCode-Verified 测试模型用代码实现物理、数学、材料科学和生物学等领域复杂科学工作流的能力。 

ML4 与 GLM5.3 在 STEM 任务(数学和物理)上的内部评估

知识工作

ML4 是我们面向专业人士日常处理的现实世界任务的最强模型。它能够创建、编辑和修复复杂的电子表格和文档,在法律和金融基准测试中均展现出典范级表现。

值得注意的是,我们通过第三方评估机构(vals.ai)在法律和金融任务的代表性任务上对 ML4 进行了评估,发现该模型在这两种情况下均超过 GPT-6-Astra。在 HarveyAI 的法律智能体基准测试中,ML4 的表现优于所有开源模型。

FinWorkBench 测试模型在真实的金融和会计用例中创建/编辑电子表格的能力。

财务分析要求精确性以及从多个来源综合信息的能力,而在当今许多金融机构中,这一过程仍然十分耗时。在此演示中,ML4 与其他顶尖开源模型一同应对同一项多步骤企业融资挑战,检索上市公司申报文件和财务报告,例如通过 EDGAR 及同等欧洲数据库获取的文件。一张动画语义地图追踪每个模型通向解决方案的路径,突出显示沿途检索到的每一份文件。每条轨迹的位置反映了已收集的证据、计算结果以及仍未解决的问题。观众可以观察调查如何展开,并比较每个模型在得出最终答案之前所走的不同路径。

模型安全性

ML4 在我们针对间接提示注入鲁棒性的基准测试中已全部达到饱和,使其处于开源模型的前沿(与 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813 相比)。在 Lakera 公开的 B3 AI Security Benchmark 上,ML4 抵御了 93.3% 的攻击——我们在竞争者中未看到更高的分数。

ML4 与用户的互动也比我们以往任何模型都更负责任。我们重点展示在 KORA Benchmark 上的结果,ML4 再次在我们测得的开源模型中得分最高(1.691,最高为 2,被标记为“Exemplary”)。 

特别相关的是,该模型倾向于拒绝有关网络安全的恶意请求。尽管在 Cyber 基准测试中表现强劲,但该模型对来自 JailbreakBench、StrongREJECT 和 AgentHarm 的 cyber 提示的平均拒绝率高于所有开源模型。

人工评估

我们进行了一项内部评估,由编程、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员比较 Mistral Large 4 与 GLM-5.3。ML4 在 CAD 和 STEM 领域更受青睐,而在金融和编程领域表现与 GLM-5.3 持平或接近。

大规模强化学习

基础模型进步迅速,我们的后训练必须跟上步伐。为昨天的模型调优的方案用在今天的前沿模型上会浪费能力,因为曾经将模型推向极限的真实样本已不再如此。我们使用强化学习(RL),因为它随模型一起适应:我们基于模型自身尝试的结果进行训练,并且可以随着模型变强提高任务的难度和广度。

我们的 RL 库旨在让新环境易于添加并大规模训练。一个共享、可组合的接口允许单次训练运行组合从单轮聊天、复杂科学问题求解到安全对齐、事实性和长时程工具使用等任务。这些环境共享脚手架和资源,如代码沙箱、网络搜索和外部 API。同样的可组合性也延伸到验证,按每个任务的需要组合奖励模型、单元测试、LLM 评判和静态检查。

在运行时,一组自动扩缩容的 actor 并行生成数万条 rollout,同时模型训练异步进行。生成与训练流水线针对长轨迹进行了优化,支持跨多次压缩、达到数百万 token 的 rollout 预算,同时保持较低的陈旧度。两个阶段中的新颖方法与优化最大限度地减少了离策略漂移,使强化学习能够在长时间跨度上稳定运行。

在我们当前的规模下(3k 块 GPU),单次训练运行每天大约产生 330 亿个 token,经过过滤和掩码后,其中约 160 亿个为可训练的补全 token。我们可以直接从训练 rollout 中看到运行进展:随着策略学会解决越来越复杂的任务,训练奖励在多个代表性环境中上升。以下是一些示例。

这些改进并非特定于我们训练所用的环境;它们能迁移到下游评测中,而最终模型的这些改进归功于两个后训练阶段(监督微调和强化学习),如这些图表所示。

接下来会发生什么

这仅仅是开始。ML4 是由我们 30 亿欧元 D 轮融资——欧洲科技公司有史以来最大的股权融资轮——所资助路线图上的第一个里程碑。这笔资金已经在投入使用:我们正在大幅扩展位于我们自有欧洲数据中心的计算容量,未来几个月还会有更多容量上线。

更多算力意味着更多训练。这次预览背后的强化学习运行仍在进行中,而模型没有显示出任何饱和迹象——前方仍有巨大的提升空间。随着我们在扩展后的基础设施上扩大训练规模,我们预计在未来数周和数月内会取得大幅而快速的改进。

我们将在月底前发布权重,以及关于架构、更多基准测试和我们后训练方法的更多细节。而 ML4 只是基础:它将成为新一代专业化和优化版 Mistral 模型的基础,这些模型专为我们客户最关心的行业和工作负载而构建。

从这里开始的进展速度将会很快。敬请期待。

来源:Mistral AI:News · mistral.ai