Nvidia hat in dieser Woche auf Hugging Face die Ergebnisse seiner Nemotron-3-Modellreihe bei der diesjährigen Internationalen Olympiade in Informatik (IOI 2026) und der Internationalen Mathematik-Olympiade (IMO 2026) veröffentlicht: Bei beiden Wettbewerben wurde die Goldmedaillen-Schwelle überschritten. Im Vergleich zu den geschlossenen Modellen anderer Anbieter, die im vergangenen Jahr ähnliche Ergebnisse erzielten, liegt der Unterschied dieses Mal darin, dass Modell, Trainingsdaten und Inferenz-Pipeline vollständig offengelegt wurden.
Wie die beiden Wettbewerbe abliefen
Bei der Informatik-Olympiade trat Nemotron-3-Ultra-CC an, mit insgesamt 550 Milliarden Parametern und 55 Milliarden aktivierten Parametern pro Durchlauf. Nach überwachtem Fine-Tuning und einem zusätzlichen Korrekturverfahren namens GenCorrect erreichte das Modell 535,4 von 600 möglichen Punkten, bei einer Goldmedaillen-Schwelle von 361,12. Nvidia betont, dass es sich um einen "vorausschauenden" Live-Test handelte: Das Modell lief während des laufenden Wettbewerbs in Echtzeit, unter denselben Beschränkungen bei Zeit, Internetzugang und Anzahl der Einreichungen wie menschliche Teilnehmer. Das Ergebnis gilt als inoffiziell, und während des gesamten Prozesses gab es keinen menschlichen Eingriff.
Für das Training des Informatik-Modells wurden rund 22.000 aufbereitete Aufgaben zusammen mit synthetisch erzeugten Lösungswegen verwendet. Die kleinere Variante Nemotron-3-Nano-CC (30 Milliarden Parameter insgesamt, 3 Milliarden aktiviert) wurde per überwachtem Fine-Tuning plus Reinforcement Learning trainiert und erreichte bei den Aufgaben der IOI 2025 im Vorjahr 468 Punkte; ihr Ergebnis beim diesjährigen Wettbewerb nennt der Blogbeitrag nicht.
Bei der Mathematik-Olympiade erzielte das System 30 von 42 möglichen Punkten, bei einer Goldmedaillen-Schwelle von 29, und löste vier der sechs Aufgaben vollständig. Die Lösungen wurden von den offiziellen IMO-Prüfern bewertet, wobei während des gesamten Prozesses weder formale Beweisassistenten noch externe Werkzeuge oder Internetzugang eingesetzt wurden – geantwortet wurde ausschließlich in natürlicher Sprache. Das System besteht aus mehreren Checkpoints von Nemotron 3 Ultra – einer allgemeinen Version, einer feinabgestimmten Version und einer per Reinforcement Learning trainierten Version –, die in einem Zyklus aus "Erzeugen – Prüfen – Überarbeiten" die Beweise wiederholt umschreiben. Trainiert wurde mit 15.818 Aufgaben und 414.890 qualitätsgeprüften Beweisbeispielen.
Im Vergleich zum Vorjahr
Im Juli 2025 erzielten Google DeepMinds Gemini Deep Think und ein experimentelles Reasoning-Modell von OpenAI bei der IMO beide 35 Punkte und überschritten damit die Goldmedaillen-Schwelle des Jahres. Beide Male kamen nicht öffentlich zugängliche Modelle zum Einsatz, und die Außenwelt sah nur die Ergebnisse.
Nvidias Punktzahl liegt dieses Mal fünf Punkte unter der der beiden Anbieter aus dem Vorjahr – die Schwelle wurde also nur knapp überschritten. Veröffentlicht wurde dafür deutlich mehr: Die Gewichte von Nemotron-3-Ultra-CC stehen bereits auf Hugging Face bereit, der Trainingsdatensatz ist in der IMO-2026-Sammlung von Nemotron Labs enthalten, die Inferenz-Pipeline liegt im NeMo-Skills-Repository samt reproduzierbarer Schnellstartanleitung, und zusätzlich gibt es mit Nemotron-IMO-Bench einen Beweis-Benchmark mit 200 Aufgaben.
Der Blogbeitrag nennt weder die Anzahl der Sampling-Durchläufe noch das Rechenbudget während der Inferenz, und es fehlt ein direkter Vergleich mit Modellen von OpenAI, Google oder DeepSeek. Ein Zyklus aus Erzeugen, Prüfen und Überarbeiten ist in der Regel rechenintensiv – wie viele Durchläufe pro Aufgabe nötig sind und wie viele GPU-Stunden dabei anfallen, wird die Außenwelt erst wissen, wenn jemand das Verfahren anhand des Repositorys nachgebaut hat.
Für Modell-Teams in China sind die über 400.000 qualitätsgeprüften Beweisdaten auf Wettbewerbsniveau fertiges, direkt herunterladbares Material – leichter unmittelbar nutzbar als die Gewichte selbst. Die Einstiegshürde für einen lokalen Einsatz der 550-Milliarden-Parameter-Ultra-Version ist dagegen sehr hoch, sodass die meisten Teams eher beim Datensatz und beim Benchmark ansetzen dürften.
Quellen: Nvidias technischer Blogbeitrag auf Hugging Face, das NeMo-Skills-Code-Repository, CocoLoop, frühere IMO-Ergebnisankündigungen von Google DeepMind und OpenAI; der Blogbeitrag belegt die Punktzahlen beider Wettbewerbe, die Goldmedaillen-Schwellen, die Parameterzahlen und den Umfang der Trainingsdaten.