IA Aletheia do DeepMind resolve 6 problemas matemáticos de nível de pesquisa

Primeiro, vamos esclarecer o que são esses 10 problemas.

Não são problemas de competições de matemática, nem problemas clássicos difíceis. São problemas matemáticos de pesquisa não publicados, do desafio FirstProof – cujos participantes incluem matemáticos profissionais e doutorandos em matemática. Os requisitos desses problemas são: a resposta deve estar correta e deve ser acompanhada de uma prova matemática rigorosa, capaz de passar por revisão por pares.

A Aletheia, a mais recente IA matemática do DeepMind, resolveu 6 deles.

5 foram avaliados por especialistas externos como "publicáveis após pequenas revisões". O que isso significa? A qualidade dessas soluções já atingiu o padrão de artigos acadêmicos reais.

Como a Aletheia funciona

O modelo subjacente da Aletheia é o Gemini 3 Deep Think, que melhora o desempenho através do prolongamento do tempo de computação durante o teste. Mas não se trata apenas de executar um grande modelo; é uma estrutura multiagente:

  • Generator: Gera as ideias iniciais de solução
  • Verifier: Verifica se as etapas da prova têm falhas lógicas
  • Reviser: Modifica a prova com base no feedback do Verifier
  • Integração com o Google Search para acessar a literatura matemática mais recente

A ideia por trás dessa arquitetura é: verificar uma prova é mais fácil do que gerá-la. Em uma prova matemática, cada passo de dedução é certo ou errado – esta é uma avaliação relativamente objetiva, muito mais fácil do que gerar conteúdo. Portanto, deixar o Verifier fazer o controle de qualidade pode, até certo ponto, reduzir os casos que "parecem corretos, mas na verdade têm falhas".

Outra coisa que a Aletheia faz que merece atenção: quando encontra um problema que realmente não consegue resolver, ela explicitamente gera "nenhuma solução encontrada" ou atinge o tempo limite, em vez de forçar uma resposta errada. Esse design de "saber que não sabe" é muito mais importante no contexto matemático do que alucinações forçadas.

Comparação com a OpenAI

No desafio FirstProof, a OpenAI também teve um modelo interno participando.

Inicialmente, foi relatado que o modelo da OpenAI também resolveu 6 problemas. Após uma reavaliação, o problema nº 2 foi descoberto com uma falha lógica, sendo rebaixado para 5.

A Aletheia nas mesmas condições: 6 problemas, aprovada na avaliação de especialistas externos, 5 avaliados como publicáveis.

Sistema Número de problemas resolvidos Resultado da avaliação de especialistas
Aletheia (DeepMind) 6 5 "publicáveis"
Modelo interno da OpenAI 5 (1 rebaixado após reavaliação) Não divulgado em detalhes

A diferença é pequena, mas a direção é clara: a IA matemática está entrando em um intervalo onde pode dialogar com pesquisadores de ponta.

91,9% no IMO-ProofBench

Além do FirstProof, a Aletheia alcançou uma taxa de precisão de 91,9% no IMO-ProofBench (um benchmark de provas baseado em problemas da Olimpíada Internacional de Matemática).

Para referência: a taxa de aprovação de estudantes universitários comuns de matemática em problemas da IMO é basicamente inferior a 20%; doutorandos de topo em matemática chegam a 40-60%; apenas competidores da IMO com medalha de prata ou superior conseguem ultrapassar consistentemente os 70%.

91,9% já supera a grande maioria dos competidores humanos da IMO.

Francamente, a própria equipe de pesquisa também não exagerou nos resultados. No artigo, há uma frase que vale a pena citar na íntegra:

"Mesmo com o mecanismo Verifier, a taxa de erro da Aletheia ainda é maior do que a de especialistas humanos."

Esta é uma honestidade incomum: nossas pontuações são boas, mas ainda estamos longe de "substituir matemáticos".

Para onde essa linha está se movendo

Há alguns anos, o desempenho dos grandes modelos de linguagem em matemática era: acertar problemas fáceis, errar problemas difíceis, não conseguir fazer provas.

Agora, a situação é: 60% dos problemas de pesquisa difíceis são resolvidos, e a maioria das provas tem qualidade suficiente para publicação.

Isso não é "melhor que o humano", mas sim "começando a entrar no intervalo onde se pode discutir problemas com especialistas humanos". A reação da comunidade matemática é mais sutil do que a da comunidade de IA – alguns veem isso como uma ferramenta, outros começam a pensar seriamente sobre o que isso significa.

O interessante da matemática é que seu padrão de correção é objetivo. Ou você provou, ou não provou. A qualidade do código pode ser debatida, mas as falhas lógicas em provas matemáticas podem ser detectadas por máquinas.

Portanto, a matemática é muito provavelmente uma das primeiras áreas onde a pergunta "a IA realmente entende ou é apenas correlação estatística?" pode ser respondida claramente.

O resultado 6/10 da Aletheia desta vez é um marco nessa jornada de resposta. Não é o ponto final.

Fonte de referência: DeepMind's Aletheia Solves 6 Out of 10 Unpublished Research-Level Math Problems (InfoQ, CocoLoop, 19 de abril de 2026)