Le modèle open source de Nvidia franchit le seuil d'or à l'IOI et à l'IMO

Nvidia a publié cette semaine sur Hugging Face les résultats de sa famille de modèles Nemotron 3 à l'Olympiade internationale d'informatique (IOI 2026) et à l'Olympiade internationale de mathématiques (IMO 2026) de cette année : dans les deux compétitions, le modèle a franchi le seuil de médaille d'or. Par rapport aux résultats similaires obtenus par des modèles fermés d'autres entreprises au cours de l'année écoulée, la différence cette fois réside dans le fait que le modèle, les données d'entraînement et le pipeline d'inférence ont été rendus publics dans leur intégralité.

Comment se sont déroulées les deux épreuves

Côté informatique, c'est Nemotron-3-Ultra-CC qui a concouru, avec 550 milliards de paramètres au total et 55 milliards activés à chaque exécution, après un réglage fin supervisé (SFT) auquel s'ajoute un processus de correction appelé GenCorrect. Le score final est de 535,4 points (sur un total de 600), le seuil d'or étant fixé à 361,12. Nvidia insiste sur le fait qu'il s'agissait d'un test en conditions réelles de type « prospectif » : le modèle a tourné pendant le déroulement même de la compétition, sous les mêmes contraintes de temps, d'accès à internet et de nombre de soumissions que les participants humains. Ce score est non officiel, et aucune intervention humaine n'a eu lieu pendant le processus.

Côté données d'entraînement, le modèle d'informatique a utilisé environ 22 000 problèmes retravaillés, accompagnés de chaînes de raisonnement synthétiques. La version plus petite, Nemotron-3-Nano-CC (30 milliards de paramètres au total, 3 milliards activés), a été entraînée par SFT combiné à de l'apprentissage par renforcement (RL) et a obtenu 468 points sur les problèmes de l'IOI 2025 l'an dernier ; le billet de blog ne précise pas le résultat de cette version pour l'édition de cette année.

Côté mathématiques, le score est de 30 points (sur un total de 42), le seuil d'or étant fixé à 29, avec quatre des six problèmes résolus parfaitement. Les copies ont été corrigées par les correcteurs officiels de l'IMO, sans recours à un démonstrateur formel de théorèmes, sans outil externe et sans accès à internet — uniquement en langage naturel. Le système est composé de plusieurs points de contrôle de Nemotron 3 Ultra — une version générale, une version affinée par SFT et une version entraînée par RL — qui fonctionnent selon une boucle « générer, vérifier, réviser » pour réécrire les démonstrations de façon répétée. L'entraînement a mobilisé 15 818 problèmes et 414 890 exemples de démonstrations filtrés pour leur qualité.

Comparaison avec l'année dernière

En juillet 2025, Gemini Deep Think de Google DeepMind et un modèle de raisonnement expérimental d'OpenAI avaient tous deux obtenu 35 points à l'IMO, franchissant le seuil d'or de cette année-là. Dans les deux cas, les modèles utilisés n'avaient pas été rendus publics, et seuls les résultats étaient connus à l'extérieur.

Cette fois, le score de Nvidia est inférieur de 5 points à celui obtenu par ces deux acteurs l'année dernière, franchissant le seuil tout juste. En contrepartie, bien davantage a été publié : les poids de Nemotron-3-Ultra-CC sont déjà disponibles sur Hugging Face, le jeu de données d'entraînement figure dans la collection IMO 2026 de Nemotron Labs, le pipeline d'inférence a été déposé dans le dépôt NeMo-Skills avec un guide de démarrage reproductible, et il existe en outre un banc d'essai de démonstrations de 200 problèmes baptisé Nemotron-IMO-Bench.

Le billet de blog ne précise ni le nombre d'échantillonnages ni le budget de calcul utilisé pendant l'inférence, et ne propose aucune comparaison directe avec les modèles d'OpenAI, de Google ou de DeepSeek. Les boucles de génération, vérification et révision sont généralement très gourmandes en calcul au moment de l'inférence ; le nombre de passes et d'heures de GPU nécessaires par problème ne sera connu qu'une fois que quelqu'un aura reproduit le processus à partir du dépôt.

Pour les équipes chinoises développant des modèles, les plus de 400 000 démonstrations de niveau compétition déjà filtrées pour leur qualité constituent un matériau immédiatement téléchargeable, plus facile à exploiter directement que les poids eux-mêmes. En revanche, la barrière à l'entrée pour déployer localement la version Ultra de 550 milliards de paramètres est très élevée, ce qui rend plus probable que la majorité des équipes commencent plutôt par le jeu de données et le banc d'essai.

Sources : billet technique de Nvidia sur Hugging Face, dépôt de code NeMo-Skills, CocoLoop, précédentes annonces de résultats à l'IMO de Google DeepMind et d'OpenAI ; le billet confirme les scores des deux compétitions, les seuils d'or, le nombre de paramètres et l'ampleur des données d'entraînement.