Esta semana Nvidia publicó en Hugging Face los resultados de su familia de modelos Nemotron 3 en la Olimpiada Internacional de Informática (IOI 2026) y en la Olimpiada Internacional de Matemáticas (IMO 2026) de este año: en ambas competiciones superó el umbral de medalla de oro. A diferencia de los resultados similares obtenidos por modelos cerrados de otras empresas durante el último año, la novedad esta vez es que el modelo, los datos de entrenamiento y el proceso de inferencia se han hecho públicos por completo.
Cómo se desarrollaron las dos pruebas
En la parte de informática participó Nemotron-3-Ultra-CC, con 550 000 millones de parámetros en total y 55 000 millones activados en cada ejecución, tras pasar por ajuste fino supervisado (SFT) más un proceso de corrección llamado GenCorrect. El resultado final fue de 535,4 puntos (sobre un total de 600), con el umbral de oro en 361,12. Nvidia subraya que se trató de una prueba "prospectiva" en tiempo real: el modelo se ejecutó durante la propia competición, bajo las mismas restricciones de tiempo, acceso a internet y número de envíos que los participantes humanos. Esta puntuación es extraoficial, y no hubo intervención humana durante el proceso.
En cuanto a los datos de entrenamiento, el modelo de informática utilizó alrededor de 22 000 problemas depurados junto con cadenas de razonamiento sintéticas. La versión más pequeña, Nemotron-3-Nano-CC (30 000 millones de parámetros en total, 3000 millones activados), se entrenó con SFT combinado con aprendizaje por refuerzo (RL) y obtuvo 468 puntos en los problemas de la IOI 2025 del año pasado; la entrada del blog no indica el resultado de esta versión en la edición de este año.
En la parte de matemáticas, el resultado fue de 30 puntos (sobre un total de 42), con el umbral de oro en 29, resolviendo de forma perfecta cuatro de los seis problemas. Las respuestas fueron corregidas por los correctores oficiales de la IMO, sin usar demostradores formales de teoremas, sin herramientas externas y sin acceso a internet: todo en lenguaje natural puro. El sistema combina varios checkpoints de Nemotron 3 Ultra —la versión general, la versión con ajuste fino supervisado y la versión entrenada por aprendizaje por refuerzo— que trabajan en un ciclo de "generar, verificar y revisar" para reescribir las demostraciones de forma reiterada. El entrenamiento utilizó 15 818 problemas y 414 890 ejemplos de demostraciones filtrados por calidad.
Comparación con el año pasado
En julio de 2025, Gemini Deep Think de Google DeepMind y un modelo experimental de razonamiento de OpenAI obtuvieron ambos 35 puntos en la IMO, superando el umbral de oro de aquel año. En los dos casos se emplearon modelos no publicados, y el público solo pudo ver los resultados.
Esta vez la puntuación de Nvidia es 5 puntos inferior a la de aquellas dos empresas el año pasado, apenas suficiente para superar el umbral. Pero lo que se ha publicado es mucho más: los pesos de Nemotron-3-Ultra-CC ya están disponibles en Hugging Face, el conjunto de datos de entrenamiento está recogido en la colección IMO 2026 de Nemotron Labs, el proceso de inferencia se ha subido al repositorio NeMo-Skills con una guía de inicio rápido reproducible, y además existe un banco de pruebas de 200 problemas llamado Nemotron-IMO-Bench.
La entrada del blog no indica el número de muestreos ni el presupuesto de cómputo utilizado durante la inferencia, ni compara directamente con los modelos de OpenAI, Google o DeepSeek. Los ciclos de generar, verificar y revisar suelen consumir mucho cómputo durante la inferencia; cuántas rondas y cuántas horas de GPU requiere cada problema solo se sabrá cuando alguien reproduzca el proceso a partir del repositorio.
Para los equipos de modelos en China, las más de 400 000 demostraciones de nivel de competición ya filtradas por calidad son material descargable y disponible de inmediato, más fácil de aprovechar directamente que los propios pesos. En cambio, la barrera para desplegar localmente la versión Ultra de 550 000 millones de parámetros es muy alta, por lo que es más probable que la mayoría de los equipos empiecen por el conjunto de datos y el banco de pruebas.
Fuentes: publicación técnica de Nvidia en Hugging Face, repositorio de código NeMo-Skills, CocoLoop, anuncios anteriores de resultados de la IMO de Google DeepMind y OpenAI; la publicación confirma las puntuaciones de ambas pruebas, los umbrales de oro, el número de parámetros y la escala de los datos de entrenamiento.