A nova história matemática do Claude não deve ser lida como uma IA resolvendo um problema centenário de uma vez.
Em 10 de agosto, a Anthropic publicou materiais sobre uma versão de pesquisa inédita do Claude que recebeu a tarefa de tentar seriamente a hipótese de Riemann. O modelo não a resolveu, mas a empresa diz que ele melhorou um resultado relacionado: o limite inferior da proporção de zeros da função zeta de Riemann que satisfazem a hipótese passou de 41,6% para 67,2%.
Delimitar o resultado
A hipótese de Riemann segue em aberto. O resultado trata de uma pergunta menor: qual fração mínima dos zeros pode ser provada na linha crítica.
O pacote de evidências inclui post de pesquisa, artigo técnico escrito pelo Claude, nota para especialistas e formalização em Lean que passa por um verificador padrão. A Anthropic diz que dois matemáticos internos validaram o trabalho e que Brian Conrey e Dan Goldston o examinaram em curto prazo.
O prompt inicial foi:
“Take a real stab at the Riemann hypothesis.”
Em linguagem simples, Claude recebeu a ordem de tentar de verdade.
De onde vem 67,2%
41,6% é o limite anterior, 67,2% é o novo limite, enquanto 1859 e o prêmio de um milhão de dólares descrevem o problema maior.
O processo também pesa. Claude tentou 650 ideias sem sucesso. Depois passou um dia e meio coordenando cerca de 60 subagentes, executou 2.400 comandos shell, escreveu centenas de scripts Python e baixou 54 artigos do arXiv. A execução usou 31 milhões de tokens de saída.
Matemáticos continuam no centro
O papel humano não desapareceu. O modelo ampliou a busca, matemáticos julgaram a conexão com trabalhos anteriores e o Lean tornou parte do argumento verificável por máquina.
O próximo teste
Os próximos pontos são revisão pública independente, cobertura da formalização Lean e repetição do método em outros problemas.
Fontes: Anthropic Research, artigo técnico do Claude, repositório de formalização Lean, Clay Mathematics Institute, CocoLoop, artigos arXiv relacionados; verificação dos limites de 41,6% e 67,2%, 31 million output tokens, 650 ideas, 60 subagents, 2400 shell commands, 54 papers e status do Lean comparator.