Sete pesquisadores do Google Research submeteram um artigo ao arXiv em 30 de setembro, apresentando um sistema multiagente chamado Cogentic, voltado para encontrar demonstrações matemáticas em nível de pesquisa. Segundo o artigo, o sistema usa o Gemini como modelo base e avançou em 5 problemas abertos em três áreas — aprendizado online, teoria de leilões e design de mecanismos —; todas as demonstrações foram posteriormente verificadas de forma independente por especialistas da área e expandidas em artigos completos com coautores especialistas.
Entre os autores estão Yang Cai, também vinculado à Universidade Yale, e Vineet Gupta, também listado no Google DeepMind, além de Aranyak Mehta, Christopher Liaw, Di Wang e outros. O artigo está classificado nas categorias cs.AI e cs.GT (teoria dos jogos).
Uma única geração não basta, então virou um pipeline
O ponto de partida do artigo é simples: os modelos de linguagem já conseguem produzir boas ideias matemáticas, mas diante de problemas que exigem testar várias conjecturas ao mesmo tempo e avançar continuamente por dias, uma única geração não é mais suficiente.
A abordagem do Cogentic é dividir a busca por demonstrações entre papéis diferentes:
- O orquestrador mantém o estado global e decide quantos "demonstradores" enviar para cada direção;
- Os demonstradores escrevem demonstrações candidatas em paralelo;
- Os verificadores procuram erros a partir de ângulos complementares, com caráter adversarial;
- Os pesquisadores de literatura fornecem material de referência;
- O livro-razão (ledger) registra apenas conclusões intermediárias já verificadas, mantidas entre rodadas, para que demonstrações posteriores possam citá-las diretamente;
- Há ainda um papel de "consultor" que observa os padrões de todo o processo e ajusta os parâmetros continuamente.
Demonstrar, verificar, demonstrar de novo — o ciclo continua. O design do livro-razão resolve um problema clássico de tarefas de longo alcance: o lema que o modelo produziu em uma rodada costuma ser esquecido ou reformulado na rodada seguinte; agora, assim que passa pela verificação, fica registrado de forma permanente.
Até onde cada um dos cinco problemas avançou
De acordo com os resultados apresentados no artigo:
- Otimização linear inversa online: obteve-se pela primeira vez um limite de arrependimento (regret) eficiente de O(d), independente do horizonte temporal T, com custo computacional de O(d²) por rodada;
- Complexidade competitiva de mercados bilaterais: demonstrou-se que basta adicionar exatamente 2 vendedores a mais no lado menor para que a receita da transação alcance a alocação ótima;
- Arrependimento "a qualquer momento" (anytime) com n especialistas: apresenta-se um algoritmo anytime cuja constante coincide com a da versão de duração fixa;
- Mecanismos simples e receita ótima: a razão de aproximação de receita para um único comprador aditivo melhorou de 5,2 para 3,52;
- Preço da anarquia em lances automatizados: com 2 licitantes alcança-se o ótimo de 1,5, e com n licitantes, 2−1/(4n+1).
Quanto ao custo, o artigo informa que a maioria dos problemas chamou o Gemini na ordem de centenas de vezes, e o mais difícil, na ordem de milhares, mas não especifica qual versão do Gemini foi usada.
Em comparação com as demonstrações da OpenAI
No segundo semestre deste ano, as notícias sobre IA aplicada à matemática se multiplicaram; colocando-as lado a lado, a diferença está na abordagem de verificação.
Em agosto, a OpenAI apresentou com o Astra 10 resultados de matemática e ciência da computação teórica, acompanhados de um artigo de 249 páginas e certificados formais em Lean; a demonstração sobre Navier-Stokes anunciada em setembro mobilizou cerca de dez mil agentes rodando por 88 horas, também com arquivos Lean anexados. Certificados formais verificáveis por máquina são o argumento de venda que essa linha da OpenAI reforça repetidamente.
O artigo do Cogentic coloca o foco em outro ponto: dentro do sistema, verificadores adversariais fazem uma primeira filtragem; ao sair do sistema, pessoas com conhecimento da área leem cada demonstração uma a uma e as redigem junto com especialistas como artigos formais. O escopo dos problemas também é mais restrito: os cinco vêm da própria área de pesquisa dos autores, problemas do tipo que tem alguém de olho e que, uma vez resolvidos, podem ser avaliados por pares.
Essa escolha torna os resultados mais fáceis de serem aceitos, ao custo da capacidade de generalização. O próprio artigo reconhece que os problemas foram "escolhidos de uma área que os autores conhecem bem"; como isso funcionaria em direções que os autores não dominam, o artigo não responde.
Os leitores não conseguem acompanhar o ritmo da escrita
O artigo traz uma frase que quase coincide com o que a palestra de Terence Tao, em agosto, já alertava:
"A system like this can produce candidate results faster than they can be read."
"Um sistema como esse pode produzir resultados candidatos mais rápido do que é possível lê-los."
Os cinco problemas do Cogentic contam com a supervisão de especialistas, por isso é possível dizer que estão "verificados". Assim que essa orquestração for aberta a mais pessoas e a mais problemas, o gargalo vai recair sobre quem revisa. O artigo não informa quanto tempo os especialistas levaram para verificar cada demonstração, e é justamente esse o número que determina até que escala o sistema pode crescer.
Fontes: artigo do arXiv 2609.40324, CocoLoop, Google Research; os limites, razões de aproximação e ordens de grandeza das chamadas dos cinco resultados seguem o texto original do artigo.