一个模型系列,两项黄金级成果:针对 IOI 和 IMO 微调 Nemotron
Hugging Face Blog 发布了这条动态,详情请查看官方发布。

来自 Hugging Face Blog 的官方动态,版本与适用范围以发布方说明为准。
Hugging Face Blog · 查看官方发布中文机器翻译 · 原文附后
正文 · 来源原文
我们最近的结果表明 Nemotron 是构建世界一流专业模型的强大、适应性强的基础。从 Nemotron 3 开始,我们的团队使用监督微调 (SFT)、强化学习 (RL) 和反馈驱动推理来创建在 IMO 2026 和 IOI 2026 上均达到金牌水平的系统。
IOI 结果来自于与人类参赛者相同的时间、互联网访问和提交限制下的实时、前瞻性运行。这是一个非官方、无监督的基准测试,未包含在官方 IOI 排名中。 IMO 系统提交的校样由 IMO 官方评分员进行评分。
“易于微调”不仅仅意味着使检查点可训练。这应该意味着一个有能力的基础模型可以通过清晰的、可重用的配方来适应要求苛刻的领域。
在这两个项目中,该配方分为四个部分:
从强大的 Nemotron 基础模型开始。策划特定领域的问题和高质量的推理轨迹。应用标准的训练后方法,例如 SFT 和 RL(如果有用)。将专家模型与生成、评估和改进候选答案的推理循环配对。
训练和推理运行量很大,但基本方法是熟悉且可重复的。我们不需要为每一个挑战建立一个新的基础模型。我们专门使用 Nemotron 来完成这项任务。
对于竞争性编程,我们策划了 22,000 个问题并生成综合推理轨迹来培训两名专家。 Nemotron-3-Nano-CC 拥有 300 亿个总参数和 30 亿个活动参数,同时获得了 SFT 和 RL。 Nemotron-3-Ultra-CC 拥有 5500 亿个总参数和 550 亿个活跃参数,获得了 SFT。
IOI 2025 的进展使专业化的价值显而易见。 Nano 从训练后的 130 分提高到 SFT 后的 280 分和 RL 后的 291 分。借助我们的迭代生成-评估-优化策略 GenCorrect,它达到了 468 分,并跨越了 438.3 的黄金门槛。 Ultra-CC 在相同的测试时间策略下达到了 502 分。
这些实验还表明,适应不必在每个尺度上都看起来相同。 Nano 的大部分增益是由 SFT 产生的,而 RL 则带来了较小但一致的改进。对于更强大的 Ultra 模型,一个 SFT epoch 足以在 IOI、ICPC 和 LiveCodeBench Pro 上超越完全经过后训练的 Nano 模型。这一发现指导了 IOI 2026 比赛专用的 Ultra-CC 系统,该系统在满分 600 分的评分中获得了 535.4 分。
IMO 项目将同样的想法应用于奥林匹克数学。从 Nemotron 3 Ultra 开始,我们用 SFT 培训了一名专家,用 RL 培训了另一名专家。
SFT 语料库包含 15,818 个独特证明问题的 414,890 个经过质量过滤的示例。它的作用不仅仅是教导最终答案。这些数据涵盖了证明生成、细化、验证和元验证,因此模型学会了构建论据、识别差距、回应批评以及判断证明是否完整。强化学习模型针对在模型能力边界附近选择的 9,597 个证明问题进行了训练。
在开发实验中,两个经过训练的检查点都优于通用可用性模型。 SFT 检查点在第一轮搜索中最强,而 RL 检查点取得了最好的整体单检查点结果。他们的优势是互补的,因此最终的系统同时使用了两位专家和通用模型。
对于每个 IMO 问题,模型都会生成候选证明、对其进行评分、提出批评并完善最有希望的尝试。一个单独的高计算阶段选择了最终提交的内容。整个系统以自然语言运行,没有正式的证明、外部工具或互联网接入。总分 42 分,得分为 30 分,其中 6 题中有 4 题满分,超出了官方金牌门槛。
查看英文原文
One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
Hugging Face Blog 发布了这条动态,详情请查看官方发布。
正文 · 来源原文
Our recent results show that Nemotron is a strong, adaptable foundation for building world-class specialist models. Starting from Nemotron 3, our teams used supervised fine-tuning (SFT), reinforcement learning (RL), and feedback-driven inference to create systems that reached gold-medal level at both IMO 2026 and IOI 2026.
The IOI result came from a live, prospective run under the same time, internet-access, and submission constraints as human contestants. It was an unofficial, unsupervised benchmark and was not included in the official IOI ranking. The IMO system’s submitted proofs were graded by official IMO graders.
"Easy to fine-tune" should mean more than making a checkpoint trainable. It should mean that a capable foundation model can be adapted to a demanding domain with a clear, reusable recipe.
Across the two projects, that recipe had four parts:
Start with a strong Nemotron base model. Curate domain-specific problems and high-quality reasoning traces. Apply standard post-training methods such as SFT and, where useful, RL. Pair the specialist model with an inference loop that generates, evaluates, and improves candidate answers.
The training and inference runs were substantial, but the underlying approach is familiar and reproducible. We did not need to build a new foundation model for every challenge. We specialized Nemotron for the task.
