精选Hugging Face Blog短讯
一个模型家族,两项金牌级成果:微调 Nemotron 斩获 IOI 和 IMO 佳绩
Nemotron 模型通过微调在信息学奥林匹克(IOI)和国际数学奥林匹克(IMO)中取得金牌级别的成绩。这展示了该模型在复杂推理和解题能力上的显著提升,标志着 AI 在学术竞赛领域的重要突破。
我们最近的研究结果表明,Nemotron 是一个强大且适应性强的基础模型,可用于构建世界级的专业模型。从 Nemotron 3 开始,我们的团队利用监督微调(SFT)、强化学习(RL)以及反馈驱动的推理技术,创建了在国际数学奥林匹克竞赛(IMO)2026 和国际信息学奥林匹克竞赛(IOI)2026 中均达到金牌水平的系统。

| 竞赛 | Nemotron 专业化版本 | 结果 |
|---|---|---|
| IOI 2026 | 采用 SFT 和 GenCorrect 的 Nemotron-3-Ultra-CC | 535.4/600,高于 361.12 的金牌门槛及人类最高分 498.27 |
| IMO 2026 | 在生成-验证-优化系统中使用的 Nemotron 3 Ultra 通用、SFT 和 RL 检查点 | 30/42,高于官方金牌门槛 29 |
IOI 的结果来自一次实时的前瞻性运行,其时间、互联网访问权限和提交限制与人类参赛者相同。这是一项非官方的无监督基准测试,未计入官方 IOI 排名。IMO 系统提交的证明由官方 IMO 评分员进行评分。
可复用的专业化配方
“易于微调”不应仅意味着使一个检查点具备训练能力。它应意味着一个有能力的基础模型能够通过清晰、可复用的配方适应高要求的领域。
在这两个项目中,该配方包含四个部分:
- 从一个强大的 Nemotron 基础模型开始。
- 策划特定领域的题目和高质量的推理轨迹。
- 应用标准的后训练方法,如 SFT,并在有益时使用 RL。
- 将专业模型与一个生成、评估和改进候选答案的推理循环相结合。
训练和推理过程规模庞大,但底层方法是熟悉且可复现的。我们无需为每个挑战构建新的基础模型。我们将 Nemotron 针对任务进行了专业化改造。
从通用编码能力到 IOI 金牌
对于竞技编程,我们策划了 22,000 道题目并生成了合成推理轨迹以训练两个专业模型。拥有 300 亿总参数和 30 亿激活参数的 Nemotron-3-Nano-CC 接受了 SFT 和 RL 训练。拥有 5500 亿总参数和 550 亿激活参数的 Nemotron-3-Ultra-CC 接受了 SFT 训练。
IOI 2025 的进展清晰地展示了专业化的价值。Nano 在后训练前的得分为 130 分,经过 SFT 后提升至 280 分,经过 RL 后进一步提升至 291 分。借助 GenCorrect——我们的迭代式生成-评估-优化策略——它达到了 468 分,并跨越了 438.3 分的金牌门槛。Ultra-CC 使用相同的测试时策略达到了 502 分。

这些实验还表明,适配在不同规模下不必呈现相同的形态。SFT 产生了 Nano 的大部分增益,而 RL 带来了较小但一致的改进。对于更强的 Ultra 模型,仅需一个 SFT 轮次即可在 IOI、ICPC 和 LiveCodeBench Pro 上超越完全后训练的 Nano 模型。这一发现指导了用于 IOI 2026 的竞赛专用 Ultra-CC 系统,该系统获得了 600 分中的 535.4 分。
教导 Nemotron 证明、检查和修订
IMO 项目将同样的理念应用于奥林匹克数学。从 Nemotron 3 Ultra 开始,我们使用 SFT 训练了一个专业模型,使用 RL 训练了另一个。
SFT 语料库包含了 15,818 个独特证明问题中的 414,890 个经过质量过滤的示例。它不仅教授最终答案。数据涵盖了证明生成、优化、验证和元验证,因此模型学会了构建论点、识别漏洞、回应批评以及判断证明是否完整。RL 模型是在靠近模型能力边界的 9,597 个证明问题上进行训练的。
两个后训练检查点在开发实验中均优于通用可用模型。SFT 检查点在首轮搜索中表现最强,而 RL 检查点实现了最佳的整体单检查点结果。它们的优势互补,因此最终系统在通用模型之外同时使用了这两个专业模型。
对于每一道 IMO 试题,模型均生成候选证明、对其进行评分、提出批评意见,并优化最有希望的尝试方案。一个独立的高算力阶段负责筛选最终提交的答案。整个系统以自然语言运行,未使用形式化证明器、外部工具或互联网访问权限。该系统获得 30/42 分,在六道题中的四道题上获得满分,超过了官方金牌分数线。

微调与测试时计算协同作用
我们此前关于 IOI 2025 的 Hugging Face 博文展示了测试时计算如何将开源权重模型推向金牌水平。新结果增添了一个重要维度:更专业的模型能为推理系统提供质量更高的候选答案、更精准的批评者以及更有效的优化方案。
在 IOI 中,GenCorrect 将微调带来的收益转化为多轮反馈后的更大提升。在 IMO 中,结合互补的监督微调(SFT)和强化学习(RL)检查点,比单纯从一个检查点抽取更多样本更具价值。在这两种情况下,最佳成果均来自于将能力强大的专业模型与具备搜索、验证和改进能力的系统相结合。
这一区别至关重要。这些奖牌并非仅靠微调获得,也非仅靠暴力采样获得。它们源于对模型、数据和推理循环的共同设计。
Hugging Face 上的开源模型、数据与方法
我们希望这些成果能超越竞赛本身产生价值。Nemotron Labs IMO 2026 合集汇集了 SFT 和 RL 检查点、两份训练数据集,以及 Nemotron-IMO-Bench——一个包含 200 道奥林匹克级别问题的新基准测试。IMO 论文阐述了训练方法及“生成-验证-优化”系统,而 NeMo-Skills 仓库则包含了 IMO 推理流水线、提示词、提交的证明以及可复现的快速入门指南。针对竞技编程,Nemotron-3-Ultra-CC 模型已在 Hugging Face 上线,IOI 论文提供了训练配方及 GenCorrect 方法论。IOI 的评估与推理流水线同样收录于 NeMo-Skills 中。
IMO 与 IOI 共同为一种简单理念提供了极具挑战性的证据:Nemotron 可被微调为世界级的领域专家,随后通过透明的推理工作流进行组合,从而解决人类竞争前沿的问题。
我们期待看到 Hugging Face 社区接下来构建的内容。
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。