輝達本週在Hugging Face發文,公布Nemotron 3系列模型在今年國際資訊奧林匹亞(IOI 2026)與國際數學奧林匹亞(IMO 2026)的成績:兩項都跨過了金牌門檻。相較過去一年各家封閉模型公布的類似成績,這次不同的地方在於模型本體、訓練資料與推理流程全部公開。
兩場競賽怎麼考
資訊奧林匹亞這邊,出賽的是Nemotron-3-Ultra-CC,總參數5500億、每次啟動550億,先做監督式微調,再疊加一個名為GenCorrect的糾錯流程,最終拿到535.4分(滿分600分),金牌門檻是361.12分。輝達強調這是一次「前瞻式」實測:比賽進行期間即時執行,時間、連網與送出次數的限制都和人類選手一致。這個分數屬於非官方成績,比賽過程中也沒有人工介入。
訓練資料方面,資訊奧林匹亞模型用了約2萬2000道整理過的題目與合成推理過程。較小的Nemotron-3-Nano-CC(總參數300億、啟動30億)採用監督式微調加強化學習,在去年IOI 2025的題目上測得468分;它在今年這屆的成績,部落格文章裡沒有給出。
數學這邊的成績是30分(滿分42分),金牌門檻29分,六題中有四題拿到滿分。答卷由IMO官方閱卷人評分,整個過程不使用形式化證明器、不呼叫外部工具、不連網,純以自然語言作答。系統由Nemotron 3 Ultra的通用版、監督式微調版與強化學習版幾個檢查點組成,按「生成—驗證—修訂」的循環反覆改寫證明。訓練用到15,818道題目,以及經過品質篩選的414,890則證明樣本。
和一年前相比
2025年7月,Google DeepMind的Gemini Deep Think與OpenAI的一個實驗性推理模型都在IMO拿到35分,跨過當年的金牌門檻。那兩次用的都是沒有公開的模型,外界只能看到結果。
這次輝達的分數比去年那兩家低5分,剛好壓線通過。但放出來的東西更多:Nemotron-3-Ultra-CC的權重已在Hugging Face上架,訓練資料集收在Nemotron Labs的IMO 2026合集裡,推理流程放進NeMo-Skills程式碼庫並附上可重現的快速上手說明,另外還有一個200題的證明評測集Nemotron-IMO-Bench。
部落格文章沒有給出推理時的取樣次數與運算資源預算,也沒有和OpenAI、Google、DeepSeek的模型做直接比較。生成—驗證—修訂這類流程通常很耗推理運算資源,一題要跑多少輪、花多少GPU時間,外界要等有人照著程式碼庫重現之後才會知道。
對中國大陸的模型團隊來說,四十多萬則篩選過的競賽級證明資料是現成可下載的素材,比權重本身更容易直接拿來用。5500億參數的Ultra版本地部署門檻很高,多數團隊更可能從資料集與評測集入手。
參考來源:輝達Hugging Face技術部落格文章、NeMo-Skills程式碼庫、CocoLoop、Google DeepMind與OpenAI先前的IMO成績公告;部落格文章用於核對兩場競賽的分數、金牌門檻、參數量與訓練資料規模。