El sistema multiagente de Google resuelve cinco problemas abiertos de informática teórica

Siete investigadores de Google Research publicaron un artículo en arXiv el 30 de septiembre en el que presentan un sistema multiagente llamado Cogentic, diseñado para encontrar demostraciones matemáticas de nivel de investigación. Según el artículo, el sistema usa Gemini como modelo base y avanzó en 5 problemas abiertos en tres áreas —aprendizaje en línea, teoría de subastas y diseño de mecanismos—; todas las demostraciones fueron verificadas de forma independiente por expertos del área y ampliadas hasta convertirse en artículos completos con coautores expertos.

Entre los autores figuran Yang Cai, que también está afiliado a la Universidad de Yale, y Vineet Gupta, que también figura en Google DeepMind, además de Aranyak Mehta, Christopher Liaw, Di Wang y otros. El artículo está clasificado en las categorías cs.AI y cs.GT (teoría de juegos).

Una sola generación no basta, así que se dividió en un flujo de trabajo

El punto de partida del artículo es simple: los modelos de lenguaje ya son capaces de producir buenas ideas matemáticas, pero ante problemas que requieren probar varias conjeturas a la vez y avanzar de forma sostenida durante días, una sola generación ya no es suficiente.

El enfoque de Cogentic consiste en repartir la búsqueda de demostraciones entre distintos roles:

  • El orquestador mantiene el estado global y decide cuántos demostradores enviar a cada dirección;
  • Los demostradores escriben en paralelo demostraciones candidatas;
  • Los verificadores buscan errores desde ángulos complementarios, con un carácter adversarial;
  • Los buscadores de literatura aportan material de referencia;
  • El libro de registro (ledger) solo incorpora conclusiones intermedias ya verificadas, que se conservan entre rondas para que las demostraciones posteriores puedan citarlas directamente;
  • Además hay un rol de "asesor" que vigila los patrones de todo el proceso y ajusta los parámetros sobre la marcha.

Demostrar, verificar y volver a demostrar: el ciclo continúa. El diseño del libro de registro resuelve un problema clásico de las tareas de largo alcance: el lema que el modelo produjo en una ronda suele olvidarse o reformularse en la siguiente; ahora, en cuanto pasa la verificación, queda fijado de forma permanente.

Hasta dónde se avanzó en cada uno de los cinco problemas

Según los resultados que presenta el artículo:

  1. Optimización lineal inversa en línea: se obtuvo por primera vez una cota de arrepentimiento (regret) eficiente de O(d), independiente del horizonte temporal T, con un coste computacional de O(d²) por ronda;
  2. Complejidad competitiva de mercados bilaterales: se demostró que basta con añadir exactamente 2 vendedores más en el lado más pequeño para que el ingreso del intercambio alcance la asignación óptima;
  3. Arrepentimiento "anytime" con n expertos: se presenta un algoritmo anytime cuya constante coincide con la de la versión de duración fija;
  4. Mecanismos simples e ingresos óptimos: la razón de aproximación de ingresos para un único comprador aditivo mejoró de 5,2 a 3,52;
  5. Precio de la anarquía en pujas automatizadas: con 2 postores se alcanza el óptimo de 1,5, y con n postores, 2−1/(4n+1).

En cuanto al coste, el artículo indica que la mayoría de los problemas invocó a Gemini en el orden de cientos de veces, y el más difícil, en el orden de miles, aunque no se especifica qué versión de Gemini se utilizó.

Comparado con las demostraciones de OpenAI

En la segunda mitad de este año se han acumulado noticias sobre IA aplicada a las matemáticas; comparándolas, la diferencia está en el enfoque de verificación.

En agosto, OpenAI presentó con Astra 10 resultados de matemáticas e informática teórica, acompañados de un artículo de 249 páginas y certificados formales en Lean; la demostración sobre Navier-Stokes anunciada en septiembre movilizó cerca de diez mil agentes durante 88 horas, también con archivos Lean adjuntos. Los certificados formales verificables por máquina son el argumento que esta línea de OpenAI repite constantemente.

El artículo de Cogentic pone el énfasis en otro aspecto: dentro del sistema, verificadores adversariales hacen un primer filtrado; al salir del sistema, personas con conocimiento del área leen cada demostración una por una y las redactan junto con expertos como artículos formales. El alcance de los problemas también es más acotado: los cinco provienen del propio campo de investigación de los autores, problemas del ámbito que alguien vigila de cerca y que, una vez resueltos, pueden ser evaluados por pares.

Esta elección facilita que los resultados sean aceptados, al precio de la capacidad de generalización. El propio artículo reconoce que los problemas se "eligieron de un área que los autores conocen bien"; qué tan bien funcionaría en direcciones que los autores no dominan es algo que el artículo no responde.

Los lectores no dan abasto con el ritmo de escritura

El artículo incluye una frase que coincide casi exactamente con lo que Terence Tao expresó en su charla de agosto:

"A system like this can produce candidate results faster than they can be read."

"Un sistema como este puede producir resultados candidatos más rápido de lo que se pueden leer."

Los cinco problemas de Cogentic cuentan con la supervisión de expertos, por eso puede decirse que están "verificados". Si este esquema de orquestación se abre a más personas y a más problemas, el cuello de botella recaerá sobre quienes revisan. El artículo no indica cuánto tiempo tardaron los expertos en verificar cada demostración, y ese es precisamente el dato que determina hasta qué escala puede crecer el sistema.

Fuentes: artículo de arXiv 2609.40324, CocoLoop, Google Research; las cotas, razones de aproximación y órdenes de magnitud de las llamadas de los cinco resultados siguen el texto original del artículo.