Claude leva limite zeta a 67%

A nova história matemática do Claude não deve ser lida como uma IA resolvendo um problema centenário de uma vez.

Em 10 de agosto, a Anthropic publicou materiais sobre uma versão de pesquisa inédita do Claude que recebeu a tarefa de tentar seriamente a hipótese de Riemann. O modelo não a resolveu, mas a empresa diz que ele melhorou um resultado relacionado: o limite inferior da proporção de zeros da função zeta de Riemann que satisfazem a hipótese passou de 41,6% para 67,2%.

Delimitar o resultado

A hipótese de Riemann segue em aberto. O resultado trata de uma pergunta menor: qual fração mínima dos zeros pode ser provada na linha crítica.

O pacote de evidências inclui post de pesquisa, artigo técnico escrito pelo Claude, nota para especialistas e formalização em Lean que passa por um verificador padrão. A Anthropic diz que dois matemáticos internos validaram o trabalho e que Brian Conrey e Dan Goldston o examinaram em curto prazo.

O prompt inicial foi:

“Take a real stab at the Riemann hypothesis.”

Em linguagem simples, Claude recebeu a ordem de tentar de verdade.

De onde vem 67,2%

41,6% é o limite anterior, 67,2% é o novo limite, enquanto 1859 e o prêmio de um milhão de dólares descrevem o problema maior.

O processo também pesa. Claude tentou 650 ideias sem sucesso. Depois passou um dia e meio coordenando cerca de 60 subagentes, executou 2.400 comandos shell, escreveu centenas de scripts Python e baixou 54 artigos do arXiv. A execução usou 31 milhões de tokens de saída.

Matemáticos continuam no centro

O papel humano não desapareceu. O modelo ampliou a busca, matemáticos julgaram a conexão com trabalhos anteriores e o Lean tornou parte do argumento verificável por máquina.

O próximo teste

Os próximos pontos são revisão pública independente, cobertura da formalização Lean e repetição do método em outros problemas.

Fontes: Anthropic Research, artigo técnico do Claude, repositório de formalização Lean, Clay Mathematics Institute, CocoLoop, artigos arXiv relacionados; verificação dos limites de 41,6% e 67,2%, 31 million output tokens, 650 ideas, 60 subagents, 2400 shell commands, 54 papers e status do Lean comparator.