Nemotron 微调后在 IOI 2026 和 IMO 2026 双双达到金牌水平
One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
NVIDIA Nemotron 团队基于 Nemotron 3,通过 SFT、RL 和反馈驱动推理,让模型在 IOI 2026 和 IMO 2026 均达到金牌水平。
原文给出从基础模型到 IOI 和 IMO 金牌水平的完整微调配方,训练数据和推理管线均已开放,可复现。
国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)考察的是不同的能力。IOI 要求在严格的时间和提交限制下,通过隐藏测试的算法和代码。IMO 要求严谨的自然语言证明。在这两项竞赛中取得成功都很困难。而同时在这两项中取得成功,则指向更广泛的能力。
我们近期的结果表明,Nemotron 是构建世界级专家模型的强大、可适配的基础。从 Nemotron 3 出发,我们的团队使用监督微调(SFT)、强化学习(RL)和反馈驱动的推理,创建了在 IMO 2026 和 IOI 2026 上均达到金牌水平的系统。
| 竞赛 | Nemotron 专业化 | 结果 |
|---|---|---|
| IOI 2026 | 采用 SFT 和 GenCorrect 的 Nemotron-3-Ultra-CC | 535.4/600,高于 361.12 的金牌分数线以及人类最高分 498.27 |
| IMO 2026 | Nemotron 3 Ultra 通用、SFT 和 RL 检查点组成的生成-验证-精炼系统 | 30/42,高于官方金牌分数线 29 |
IOI 成绩来自一次实时、前瞻性的运行,时间、互联网访问和提交限制均与人类参赛者相同。这是一次非官方、无监督的基准测试,未被纳入官方 IOI 排名。IMO 系统提交的证明由官方 IMO 评分员评分。
一套可复用的专业化配方
“易于微调”不应仅仅意味着让检查点可训练。它应该意味着一个有能力的基础模型能够通过一套清晰、可复用的配方适配到高要求的领域。
在这两个项目中,该配方包含四个部分:
- 从一个强大的 Nemotron 基础模型开始。
- 整理领域特定问题和高品质的推理轨迹。
- 应用标准的后训练方法,如 SFT,以及在有用时应用 RL。
- 将专家模型与一个生成、评估并改进候选答案的推理循环配对。
训练和推理运行规模可观,但底层方法为人熟知且可复现。我们不需要为每一个挑战都构建新的基础模型。我们为任务专业化 Nemotron。
从通用编程能力到 IOI 金牌
对于竞技编程,我们整理了 22,000 道题目,并生成合成推理轨迹来训练两个专家模型。Nemotron-3-Nano-CC 总参数 300 亿、激活参数 30 亿,接受了 SFT 和 RL。Nemotron-3-Ultra-CC 总参数 5,500 亿、激活参数 550 亿,接受了 SFT。
IOI 2025 上的进展让专业化的价值一目了然。Nano 从后训练前的 130 分提升到 SFT 后的 280 分,再到 RL 后的 291 分。借助 GenCorrect——我们的迭代式生成-评估-精炼策略——它达到 468 分,越过了 438.3 的金牌分数线。Ultra-CC 在相同的测试时策略下达到 502 分。
这些实验还表明,适配在每个规模上不必看起来一样。SFT 贡献了 Nano 的大部分增益,RL 则带来了较小但持续的提升。对于更强的 Ultra 模型,一个 SFT 轮次就足以在 IOI、ICPC 和 LiveCodeBench Pro 上超越完全后训练的 Nano 模型。这一发现指导了用于 IOI 2026 的竞赛专用 Ultra-CC 系统,该系统在 600 分中获得了 535.4 分。
教 Nemotron 证明、检查并修订
IMO 项目将同样的思路应用于奥林匹克数学竞赛。从 Nemotron 3 Ultra 出发,我们用 SFT 训练了一个专家模型,又用 RL 训练了另一个。
SFT 语料库包含 414,890 个经过质量筛选的样本,覆盖 15,818 道独特的证明题。它教的不只是最终答案。这些数据涵盖了证明生成、改进、验证和元验证,因此模型学会了构建论证、发现漏洞、回应批评,并判断证明是否完整。RL 模型则在 9,597 道接近模型能力前沿的证明题上训练。
在开发实验中,两个后训练检查点都优于通用可用模型。SFT 检查点在第一轮搜索中最强,而 RL 检查点取得了最佳的单检查点整体结果。它们的优势互补,因此最终系统将两个专家模型与通用模型一起使用。
对于每道 IMO 题目,模型生成候选证明、为其打分、给出批评,并改进最有希望的尝试。一个独立的高算力阶段选出最终提交答案。整个系统以自然语言运行,没有形式化证明器、外部工具或互联网访问。它得到 42 分中的 30 分,其中六道题中有四道获得满分,并超过了官方金牌分数线。
微调与测试时计算协同工作
我们早前的 IOI 2025 Hugging Face 博文 展示了测试时计算如何将开放权重模型推到金牌级表现。新结果补充了重要的一块:更好的专业化让推理系统拥有更好的候选、更好的批评者和更好的改进。
在 IOI 中,GenCorrect 将微调带来的收益转化为多轮反馈中的更大提升。在 IMO 中,使用互补的 SFT 和 RL 检查点比简单地从单个检查点抽取更多样本更有价值。两种情况下,最佳结果都来自将一个有能力的专家模型与一个能够搜索、验证并改进的系统相结合。
这一区别很重要。这些奖牌不是仅靠微调产生的,也不是仅靠暴力采样产生的。它们来自对模型、数据和推理循环的协同设计。
在 Hugging Face 上开放模型、数据和配方
我们希望这些结果在竞赛之外也有用。Nemotron Labs IMO 2026 合集 汇集了 SFT 和 RL 检查点、两个训练数据集,以及 Nemotron-IMO-Bench——一个包含 200 道奥林匹克级别题目的新基准。IMO 论文 描述了训练方法和生成-验证-改进系统,而 NeMo-Skills 仓库 包含 IMO 推理流水线、提示词、提交的证明以及可复现的快速开始。对于竞技编程,Nemotron-3-Ultra-CC 模型 已在 Hugging Face 上提供,IOI 论文 提供了训练配方和 GenCorrect 方法。IOI 评测与推理流水线也可在 NeMo-Skills 中获取。
IMO 和 IOI 共同为一个简单的理念提供了异常严苛的证据:Nemotron 可以被微调成世界级的领域专家,然后与透明的推理工作流组合,解决处于人类竞赛前沿的问题。
我们很期待看到 Hugging Face 社区接下来会构建什么。
来源:Hugging Face:Blog · huggingface.co


