Model open source Nvidia lampaui ambang emas IOI dan IMO

Nvidia memposting tulisan di Hugging Face minggu ini yang memaparkan hasil keluarga model Nemotron 3 di International Olympiad in Informatics (IOI 2026) dan International Mathematical Olympiad (IMO 2026) tahun ini: kedua hasil melampaui ambang medali emas. Dibandingkan dengan hasil serupa yang diumumkan model-model tertutup selama setahun terakhir, yang berbeda kali ini adalah model itu sendiri, data pelatihan, dan jalur inferensinya semuanya dirilis secara terbuka.

Bagaimana kedua kompetisi ini diuji

Untuk bidang informatika, sistem yang bertanding adalah Nemotron-3-Ultra-CC, model dengan total 550 miliar parameter dan 55 miliar parameter aktif per token, yang melalui supervised fine-tuning lalu ditambah proses koreksi bernama GenCorrect. Hasil akhirnya 535.4 poin dari total 600, melampaui ambang medali emas 361.12. Nvidia menekankan ini adalah uji "langsung": model dijalankan secara real-time selama kompetisi berlangsung, dengan batasan waktu, akses internet, dan jumlah pengiriman yang sama dengan peserta manusia. Skor ini bersifat tidak resmi, dan tidak ada campur tangan manusia selama prosesnya.

Dari sisi data pelatihan, model informatika ini dilatih dengan sekitar 22.000 soal yang sudah dikurasi plus jejak penalaran sintetis. Versi lebih kecil, Nemotron-3-Nano-CC (total 30 miliar parameter, 3 miliar aktif), menggunakan supervised fine-tuning plus reinforcement learning dan mencetak 468 poin pada soal-soal IOI 2025 tahun lalu; skornya di kompetisi tahun ini tidak disebutkan dalam tulisan tersebut.

Di bidang matematika, skornya adalah 30 dari 42 poin, di atas ambang medali emas 29 poin, dengan empat dari enam soal mendapat nilai sempurna. Jawaban dinilai oleh juri resmi IMO, dan seluruh prosesnya tidak menggunakan pembukti teorema formal, tidak memanggil alat eksternal, dan tanpa akses internet — hanya jawaban berbasis bahasa alami. Sistemnya menggabungkan beberapa checkpoint dari Nemotron 3 Ultra — versi umum, versi supervised fine-tuning, dan versi reinforcement learning — yang berputar dalam siklus "hasilkan-verifikasi-revisi" untuk menulis ulang pembuktian. Pelatihannya memakai 15.818 soal dan 414.890 sampel pembuktian yang sudah disaring berdasarkan kualitas.

Dibandingkan setahun lalu

Pada Juli 2025, Gemini Deep Think dari Google DeepMind dan satu model penalaran eksperimental dari OpenAI masing-masing mencetak 35 poin di IMO, melampaui ambang medali emas tahun itu. Keduanya adalah model tertutup, dan pihak luar hanya bisa melihat hasilnya.

Skor Nvidia kali ini 5 poin lebih rendah dibanding kedua model tahun lalu itu, pas melewati ambang batas. Namun yang dirilis kali ini lebih banyak: bobot Nemotron-3-Ultra-CC sudah tersedia di Hugging Face, dataset pelatihannya ada dalam koleksi IMO 2026 milik Nemotron Labs, jalur inferensinya dimasukkan ke repositori NeMo-Skills dengan panduan quickstart yang bisa direproduksi, dan ada pula benchmark pembuktian berisi 200 soal bernama Nemotron-IMO-Bench.

Tulisan ini tidak mengungkapkan jumlah sampling atau anggaran komputasi saat inferensi, dan juga tidak membuat perbandingan langsung dengan model-model dari OpenAI, Google, atau DeepSeek. Proses hasilkan-verifikasi-revisi semacam ini biasanya sangat membutuhkan komputasi saat inferensi, dan berapa banyak putaran serta jam GPU yang dibutuhkan per soal baru akan diketahui pihak luar setelah ada yang mereproduksi dari repositorinya.

Bagi tim model di China, lebih dari 400.000 sampel pembuktian berkualitas kompetisi yang sudah disaring ini adalah materi yang siap diunduh, dan lebih mudah dipakai langsung dibanding bobot modelnya sendiri. Ambang batas untuk menjalankan versi Ultra dengan 550 miliar parameter secara lokal sangat tinggi, sehingga sebagian besar tim lebih mungkin memulai dari dataset dan benchmark ini.

Sumber: tulisan blog teknis Nvidia di Hugging Face, repositori kode NeMo-Skills, CocoLoop, serta pengumuman hasil IMO sebelumnya dari Google DeepMind dan OpenAI; tulisan blog digunakan untuk memverifikasi skor, ambang medali emas, jumlah parameter, dan skala data pelatihan kedua kompetisi.