英伟达开源模型过了IOI和IMO金牌线

英伟达本周在 Hugging Face 发文,公布 Nemotron 3 系列模型在今年国际信息学奥赛(IOI 2026)和国际数学奥赛(IMO 2026)上的成绩:两项都过了金牌分数线。和过去一年各家闭源模型的同类成绩相比,这次的不同在于模型、训练数据和推理流程全部公开。

两场比赛怎么考的

信息学这边,参赛的是 Nemotron-3-Ultra-CC,总参数 5500 亿、每次激活 550 亿,经过监督微调,再叠加一个叫 GenCorrect 的纠错流程,最终得分 535.4(满分 600),金牌线是 361.12。英伟达强调这是一次“前瞻式”实测:比赛进行期间实时跑,时间、联网和提交次数的限制跟人类选手一致。这个分数属于非官方成绩,比赛过程中也没有人工介入。

训练数据方面,信息学模型用了约 2.2 万道整理过的题目和合成推理过程。小号的 Nemotron-3-Nano-CC(总参数 300 亿、激活 30 亿)走的是监督微调加强化学习,在去年 IOI 2025 的题目上测到 468 分;它在今年这届的成绩,博文里没有给。

数学这边成绩是 30 分(满分 42),金牌线 29 分,六道题里四道拿满分。答卷由 IMO 官方阅卷人打分,整个过程不用形式化证明器、不调外部工具、不联网,纯自然语言作答。系统由 Nemotron 3 Ultra 的通用版、监督微调版和强化学习版几个检查点组成,按“生成—验证—修订”的循环反复改写证明。训练用到 15,818 道题、经过质量筛选的 414,890 条证明样本。

和一年前比

2025 年 7 月,Google DeepMind 的 Gemini Deep Think 和 OpenAI 的一个实验性推理模型都在 IMO 上拿到 35 分,跨过当年的金牌线。那两次用的都是没有公开的模型,外界只能看结果。

这次英伟达的分数比去年那两家低 5 分,刚好压线。放出来的东西更多:Nemotron-3-Ultra-CC 的权重已在 Hugging Face 上架,训练数据集收在 Nemotron Labs 的 IMO 2026 合集里,推理流水线放进 NeMo-Skills 仓库并附可复现的快速上手说明,另外还有一个 200 道题的证明评测集 Nemotron-IMO-Bench。

博文没有给出推理时的采样数量和算力预算,也没有和 OpenAI、Google、DeepSeek 的模型做直接对比。生成—验证—修订这类流程通常很吃推理算力,一道题要跑多少轮、花多少卡时,外部要等有人照着仓库复现之后才知道。

对国内的模型团队来说,四十多万条筛过的竞赛级证明数据是现成可下载的素材,比权重本身更容易被直接拿去用。5500 亿参数的 Ultra 版本地部署门槛很高,多数团队更可能从数据集和评测集入手。

参考来源:英伟达 Hugging Face 技术博文、NeMo-Skills 代码仓库、CocoLoop、Google DeepMind 与 OpenAI 此前的 IMO 成绩公告;博文核对两场比赛得分、金牌线、参数量与训练数据规模。