A Nvidia publicou nesta semana, no Hugging Face, os resultados da sua família de modelos Nemotron 3 na Olimpíada Internacional de Informática (IOI 2026) e na Olimpíada Internacional de Matemática (IMO 2026) deste ano: nas duas competições, o modelo superou a linha de medalha de ouro. Em relação aos resultados semelhantes obtidos por modelos fechados de outras empresas no último ano, a diferença agora é que o modelo, os dados de treinamento e o pipeline de inferência foram divulgados por completo.
Como foram as duas provas
Na parte de informática, o modelo que participou foi o Nemotron-3-Ultra-CC, com 550 bilhões de parâmetros no total e 55 bilhões ativados a cada execução, passando por ajuste fino supervisionado (SFT) somado a um processo de correção chamado GenCorrect. O resultado final foi 535,4 pontos (de um total de 600), com a linha de ouro em 361,12. A Nvidia destaca que se tratou de um teste "prospectivo" em tempo real: o modelo rodou durante a própria competição, sob as mesmas restrições de tempo, acesso à internet e número de submissões aplicadas aos competidores humanos. Esse resultado é extraoficial, e não houve intervenção humana durante o processo.
Quanto aos dados de treinamento, o modelo de informática usou cerca de 22 mil problemas organizados, além de cadeias de raciocínio sintéticas. A versão menor, Nemotron-3-Nano-CC (30 bilhões de parâmetros no total, 3 bilhões ativados), passou por SFT combinado com aprendizado por reforço (RL) e alcançou 468 pontos nos problemas da IOI 2025, no ano passado; o post não informa o resultado dessa versão na edição deste ano.
Na parte de matemática, o resultado foi 30 pontos (de um total de 42), com a linha de ouro em 29, resolvendo por completo quatro das seis questões. As respostas foram corrigidas pelos corretores oficiais da IMO, sem uso de provadores formais de teoremas, sem ferramentas externas e sem acesso à internet — tudo em linguagem natural pura. O sistema é composto por diversos checkpoints do Nemotron 3 Ultra: a versão geral, a versão com ajuste fino supervisionado e a versão treinada por aprendizado por reforço, que trabalham em um ciclo de "gerar, verificar e revisar" para reescrever as provas repetidamente. O treinamento usou 15.818 problemas e 414.890 exemplos de provas filtrados por qualidade.
Comparação com o ano passado
Em julho de 2025, o Gemini Deep Think, do Google DeepMind, e um modelo experimental de raciocínio da OpenAI obtiveram 35 pontos na IMO, superando a linha de ouro daquele ano. Em ambos os casos, os modelos usados não foram divulgados publicamente, e o público só teve acesso aos resultados.
Desta vez, a pontuação da Nvidia ficou 5 pontos abaixo da obtida pelas outras duas empresas no ano passado, superando a linha de ouro por uma margem pequena. Em compensação, muito mais material foi divulgado: os pesos do Nemotron-3-Ultra-CC já estão disponíveis no Hugging Face, o conjunto de dados de treinamento está reunido na coleção IMO 2026 da Nemotron Labs, o pipeline de inferência foi publicado no repositório NeMo-Skills com um guia de início rápido reproduzível, e há ainda um benchmark de provas com 200 questões chamado Nemotron-IMO-Bench.
O post não informa o número de amostras geradas nem o orçamento computacional usado durante a inferência, e também não faz comparação direta com modelos da OpenAI, do Google ou da DeepSeek. Ciclos de gerar, verificar e revisar costumam consumir bastante poder computacional durante a inferência; quantas rodadas e quantas horas de GPU cada questão exige só será conhecido depois que alguém reproduzir o processo a partir do repositório.
Para equipes de modelos na China, as mais de 400 mil provas de nível competitivo já filtradas por qualidade são material prontamente disponível para download, mais fácil de aproveitar diretamente do que os próprios pesos. Já a barreira para implantar localmente a versão Ultra, de 550 bilhões de parâmetros, é bem alta, o que torna mais provável que a maioria das equipes comece pelo conjunto de dados e pelo benchmark.
Fontes: post técnico da Nvidia no Hugging Face, repositório de código NeMo-Skills, CocoLoop, anúncios anteriores de resultados da IMO feitos pelo Google DeepMind e pela OpenAI; o post confirma as pontuações das duas provas, as linhas de ouro, o número de parâmetros e a escala dos dados de treinamento.