Primeiro, vamos esclarecer o que são esses 10 problemas.
Não são problemas de competições de matemática, nem problemas clássicos difíceis. São problemas matemáticos de pesquisa não publicados, do desafio FirstProof – cujos participantes incluem matemáticos profissionais e doutorandos em matemática. Os requisitos desses problemas são: a resposta deve estar correta e deve ser acompanhada de uma prova matemática rigorosa, capaz de passar por revisão por pares.
A Aletheia, a mais recente IA matemática do DeepMind, resolveu 6 deles.
5 foram avaliados por especialistas externos como "publicáveis após pequenas revisões". O que isso significa? A qualidade dessas soluções já atingiu o padrão de artigos acadêmicos reais.
Como a Aletheia funciona
O modelo subjacente da Aletheia é o Gemini 3 Deep Think, que melhora o desempenho através do prolongamento do tempo de computação durante o teste. Mas não se trata apenas de executar um grande modelo; é uma estrutura multiagente:
- Generator: Gera as ideias iniciais de solução
- Verifier: Verifica se as etapas da prova têm falhas lógicas
- Reviser: Modifica a prova com base no feedback do Verifier
- Integração com o Google Search para acessar a literatura matemática mais recente
A ideia por trás dessa arquitetura é: verificar uma prova é mais fácil do que gerá-la. Em uma prova matemática, cada passo de dedução é certo ou errado – esta é uma avaliação relativamente objetiva, muito mais fácil do que gerar conteúdo. Portanto, deixar o Verifier fazer o controle de qualidade pode, até certo ponto, reduzir os casos que "parecem corretos, mas na verdade têm falhas".
Outra coisa que a Aletheia faz que merece atenção: quando encontra um problema que realmente não consegue resolver, ela explicitamente gera "nenhuma solução encontrada" ou atinge o tempo limite, em vez de forçar uma resposta errada. Esse design de "saber que não sabe" é muito mais importante no contexto matemático do que alucinações forçadas.
Comparação com a OpenAI
No desafio FirstProof, a OpenAI também teve um modelo interno participando.
Inicialmente, foi relatado que o modelo da OpenAI também resolveu 6 problemas. Após uma reavaliação, o problema nº 2 foi descoberto com uma falha lógica, sendo rebaixado para 5.
A Aletheia nas mesmas condições: 6 problemas, aprovada na avaliação de especialistas externos, 5 avaliados como publicáveis.
| Sistema | Número de problemas resolvidos | Resultado da avaliação de especialistas |
|---|---|---|
| Aletheia (DeepMind) | 6 | 5 "publicáveis" |
| Modelo interno da OpenAI | 5 (1 rebaixado após reavaliação) | Não divulgado em detalhes |
A diferença é pequena, mas a direção é clara: a IA matemática está entrando em um intervalo onde pode dialogar com pesquisadores de ponta.
91,9% no IMO-ProofBench
Além do FirstProof, a Aletheia alcançou uma taxa de precisão de 91,9% no IMO-ProofBench (um benchmark de provas baseado em problemas da Olimpíada Internacional de Matemática).
Para referência: a taxa de aprovação de estudantes universitários comuns de matemática em problemas da IMO é basicamente inferior a 20%; doutorandos de topo em matemática chegam a 40-60%; apenas competidores da IMO com medalha de prata ou superior conseguem ultrapassar consistentemente os 70%.
91,9% já supera a grande maioria dos competidores humanos da IMO.
Francamente, a própria equipe de pesquisa também não exagerou nos resultados. No artigo, há uma frase que vale a pena citar na íntegra:
"Mesmo com o mecanismo Verifier, a taxa de erro da Aletheia ainda é maior do que a de especialistas humanos."
Esta é uma honestidade incomum: nossas pontuações são boas, mas ainda estamos longe de "substituir matemáticos".
Para onde essa linha está se movendo
Há alguns anos, o desempenho dos grandes modelos de linguagem em matemática era: acertar problemas fáceis, errar problemas difíceis, não conseguir fazer provas.
Agora, a situação é: 60% dos problemas de pesquisa difíceis são resolvidos, e a maioria das provas tem qualidade suficiente para publicação.
Isso não é "melhor que o humano", mas sim "começando a entrar no intervalo onde se pode discutir problemas com especialistas humanos". A reação da comunidade matemática é mais sutil do que a da comunidade de IA – alguns veem isso como uma ferramenta, outros começam a pensar seriamente sobre o que isso significa.
O interessante da matemática é que seu padrão de correção é objetivo. Ou você provou, ou não provou. A qualidade do código pode ser debatida, mas as falhas lógicas em provas matemáticas podem ser detectadas por máquinas.
Portanto, a matemática é muito provavelmente uma das primeiras áreas onde a pergunta "a IA realmente entende ou é apenas correlação estatística?" pode ser respondida claramente.
O resultado 6/10 da Aletheia desta vez é um marco nessa jornada de resposta. Não é o ponto final.
Fonte de referência: DeepMind's Aletheia Solves 6 Out of 10 Unpublished Research-Level Math Problems (InfoQ, CocoLoop, 19 de abril de 2026)