Em 2 de outubro, a Meta publicou em seu blog de pesquisa seis artigos de matemática, todos feitos em colaboração entre matemáticos e o modo de raciocínio do Muse Spark 1.1 e 1.2; cinco deles resolvem perguntas que já haviam sido formuladas publicamente, mas sem resposta.
"Proof strategies were developed and revised with help from Muse Spark"
(As estratégias de demonstração foram desenvolvidas e revisadas com a ajuda do Muse Spark.)
O que cada um dos seis artigos resolveu
Os seis artigos cobrem seis áreas: teoria da probabilidade, equações diferenciais, teoria dos grupos, otimização, física aritmética e álgebra não associativa:
| Área | Artigo | O que fez |
|---|---|---|
| Probabilidade | Limiar exato para ajuste de elipsoide gaussiano | Determina o limiar exato para quando pontos gaussianos de alta dimensão podem ser ajustados por um elipsoide |
| Equações diferenciais | Explosão em tempo finito de soluções radiais de energia negativa | Demonstra que soluções da equação de Schrödinger não linear biharmônica crítica em massa explodem em tempo finito |
| Teoria dos grupos | Grupos semiabelianos não são necessariamente monomiais | Usa um grupo de ordem 384 para refutar uma conjectura proposta por M. Kida em 2024 |
| Otimização | Relaxação baseada em anéis é justa (tight) | Responde a uma pergunta feita este ano por Del Pia e Khajavirad |
| Física aritmética | Função de dois pontos de cordas equivale a uma função de altura numa curva | Conecta a teoria de cordas p-ádica à teoria dos números, dando continuidade à ideia de Manin dos anos 1980 |
| Álgebra não associativa | Álgebras de evolução solúveis | Usa um exemplo tridimensional para refutar a conjectura de classificação de García-Martínez e Pérez-Rodríguez |
Entre os matemáticos creditados estão Aykut Arslan (dois artigos), Leonard Dinh, Joseph Phillip Brennan e Milana Golich, além de Andres Barei; o artigo de física aritmética foi assinado por Anindya Dey e mais quatro autores.
Como o processo foi definido
A Meta listou quatro práticas: uma equipe de matemáticos lidera a direção da pesquisa; outro grupo de matemáticos faz a revisão de forma independente; cada artigo marca, parágrafo por parágrafo, se foi escrito por pesquisador ou por IA; todo trabalho anterior é devidamente citado.
Esse último ponto foi aplicado no artigo de probabilidade. O problema do limiar de ajuste de elipsoide gaussiano foi resolvido de forma independente por três equipes quase ao mesmo tempo, em agosto deste ano, e o artigo da Meta reconhece esse trabalho simultâneo. Isso mostra que o problema já estava, naquele momento, dentro do alcance de matemáticos humanos, e a contribuição do modelo foi mais de "acelerar" do que de abrir sozinho um caminho novo.
O blog também deixa clara a sua orientação: "Our goal here wasn't to mass-produce papers, but to empower researchers" (o objetivo é dar força aos pesquisadores, e não produzir artigos em massa).
Ao lado do artigo do Google na mesma semana
Na mesma semana, o Google Research publicou o Cogentic, que usa vários agentes colaborando para explorar demonstrações matemáticas. Colocando os dois lado a lado, a diferença de abordagem fica evidente.
O Google concentrou seus problemas em aprendizado online, teoria de leilões e design de mecanismos; nos cinco problemas, o Gemini foi chamado, na maioria das vezes, cerca de 100 vezes, chegando a cerca de 1.000 no mais difícil, e uma razão de aproximação para receita aditiva do comprador foi reduzida de 5,2 para 3,52; cada demonstração foi revisada por especialistas da área. O destaque está no sistema: como vários agentes dividem tarefas e se verificam entre si.
Já a Meta distribuiu seus problemas em seis ramos sem relação entre si, sem divulgar o número de chamadas nem descrever a arquitetura dos agentes; o destaque está nas pessoas: quem liderou, quem revisou, quem escreveu cada trecho. As duas narrativas correspondem a duas formas de verificação: a do Google pode ter o custo estimado pelo volume de chamadas, e a da Meta pode ter a responsabilidade rastreada pela autoria.
Os dois materiais ainda têm algo em comum: a ausência de exemplos de fracasso. Nenhuma das duas empresas informou quantos problemas o modelo tentou sem conseguir resolver. Sem esse denominador, o alcance dos cinco artigos bem-sucedidos é limitado, e fica difícil para quem está de fora avaliar a taxa real de acerto do Muse Spark em matemática.
Fontes: blog de pesquisa da Meta AI, blog do Google Research, CocoLoop; verificação feita a partir do blog da Meta sobre os títulos, autores, escala dos contraexemplos e versão do modelo dos seis artigos.