Primero, aclaremos qué son estos 10 problemas.
No son problemas de competencias matemáticas, ni problemas clásicos difíciles. Son problemas matemáticos de investigación no publicados, provenientes del desafío FirstProof – cuyos participantes incluyen matemáticos profesionales y doctorandos en matemáticas. Los requisitos de estos problemas son: la respuesta debe ser correcta y debe ir acompañada de una demostración matemática rigurosa, capaz de superar una revisión por pares.
Aletheia, la IA matemática más reciente de DeepMind, ha resuelto 6 de ellos.
5 fueron evaluados por expertos externos como "publicables tras revisiones menores". ¿Qué significa esto? La calidad de estas soluciones ya ha alcanzado el estándar de artículos académicos reales.
Cómo funciona Aletheia
El modelo subyacente de Aletheia es Gemini 3 Deep Think, que mejora el rendimiento mediante la prolongación del tiempo de cómputo durante la prueba. Pero no se trata simplemente de ejecutar un modelo grande; es un marco multiagente:
- Generator: Genera las ideas iniciales de solución
- Verifier: Verifica si los pasos de la demostración tienen fallos lógicos
- Reviser: Modifica la demostración basándose en la retroalimentación del Verifier
- Integración con Google Search para acceder a la literatura matemática más reciente
La idea detrás de esta arquitectura es: verificar una demostración es más fácil que generarla. En una demostración matemática, cada paso de deducción es correcto o incorrecto – esta es una evaluación relativamente objetiva, mucho más fácil que generar contenido. Por lo tanto, dejar que el Verifier actúe como control de calidad puede, hasta cierto punto, reducir los casos que "parecen correctos pero en realidad tienen fallos".
Otra cosa que hace Aletheia que merece atención: cuando se encuentra con un problema que realmente no puede resolver, explícitamente genera "no se encontró solución" o se agota el tiempo, en lugar de forzar una respuesta incorrecta. Este diseño de "saber que no sabe" es mucho más importante en el contexto matemático que las alucinaciones forzadas.
Comparación con OpenAI
En el desafío FirstProof, OpenAI también tuvo un modelo interno participando.
Inicialmente, se informó que el modelo de OpenAI también resolvió 6 problemas. Tras una revisión, se descubrió un fallo lógico en el problema n.º 2, reduciéndose la cuenta a 5.
Aletheia en las mismas condiciones: 6 problemas, aprobada la evaluación de expertos externos, 5 evaluados como publicables.
| Sistema | Número de problemas resueltos | Resultado de la evaluación de expertos |
|---|---|---|
| Aletheia (DeepMind) | 6 | 5 "publicables" |
| Modelo interno de OpenAI | 5 (1 reducido tras revisión) | No divulgado en detalle |
La diferencia es pequeña, pero la dirección es clara: la IA matemática está entrando en un intervalo donde puede dialogar con investigadores de primer nivel.
91,9% en IMO-ProofBench
Además de FirstProof, Aletheia alcanzó una tasa de precisión del 91,9% en IMO-ProofBench (un punto de referencia de demostraciones basado en problemas de la Olimpiada Internacional de Matemática).
Como referencia: la tasa de aprobación de estudiantes universitarios comunes de matemáticas en problemas de la OMI es básicamente inferior al 20%; los doctorandos de primer nivel en matemáticas alcanzan el 40-60%; solo los competidores de la OMI con medalla de plata o superior pueden superar consistentemente el 70%.
El 91,9% ya supera a la gran mayoría de los competidores humanos de la OMI.
Francamente, el propio equipo de investigación tampoco exageró los resultados. En el artículo, hay una frase que vale la pena citar textualmente:
"Incluso con el mecanismo Verifier, la tasa de error de Aletheia sigue siendo más alta que la de los expertos humanos."
Esta es una honestidad poco común: nuestras puntuaciones son buenas, pero todavía estamos lejos de "reemplazar a los matemáticos".
¿Hacia dónde se está moviendo esta línea?
Hace unos años, el rendimiento de los grandes modelos de lenguaje en matemáticas era: acertar problemas fáciles, equivocarse en problemas difíciles, no poder hacer demostraciones.
Ahora, la situación es: se resuelve el 60% de los problemas de investigación difíciles, y la mayoría de las demostraciones tienen calidad suficiente para su publicación.
Esto no es "mejor que el humano", sino "comenzar a entrar en el intervalo donde se pueden discutir problemas con expertos humanos". La reacción de la comunidad matemática es más sutil que la de la comunidad de IA – algunos lo ven como una herramienta, otros comienzan a pensar seriamente sobre lo que significa.
Lo interesante de las matemáticas es que su estándar de corrección es objetivo. O has demostrado, o no has demostrado. La calidad del código puede debatirse, pero los fallos lógicos en las demostraciones matemáticas pueden ser detectados por máquinas.
Por lo tanto, las matemáticas son muy probablemente una de las primeras áreas donde la pregunta "¿la IA realmente entiende o es solo correlación estadística?" puede ser respondida claramente.
El resultado 6/10 de Aletheia esta vez es un hito en ese camino de respuesta. No es el punto final.
Fuente de referencia: DeepMind's Aletheia Solves 6 Out of 10 Unpublished Research-Level Math Problems (InfoQ, CocoLoop, 19 de abril de 2026)