Epoch AI publicó el 9 de octubre los primeros resultados de InnovationEval, una prueba que apunta a algo en lo que todos los laboratorios tienen puesta la vista: si un modelo de frontera, sin haber leído el artículo, es capaz de idear por sí mismo una mejora de aprendizaje automático digna de publicarse. El subtítulo que Epoch eligió para el informe es "Not yet, but it will claim otherwise": todavía no puede, pero el modelo dirá que sí.
Cómo se planteó la prueba
El punto de comparación es un artículo llamado Self-Distillation Policy Optimization (SDPO), cuya idea es que el modelo se entrene con sus propios errores pasados. Epoch pidió a unos agentes que desarrollaran un nuevo método de posentrenamiento sobre una línea base ya sólida, desde la concepción de la idea y la escritura del código hasta los experimentos y el análisis de resultados, hasta lograrlo o rendirse.
Las condiciones no fueron mezquinas: 3.000 horas de GPU por modelo, con un coste del orden de varios miles de dólares, y un entorno aislado sin conexión, de modo que no se podía consultar el texto original de SDPO. La puntuación se calcula como el porcentaje de la mejora del artículo original de SDPO que se consigue.
El boletín de notas
La primera ronda tuvo solo dos modelos. GPT-5.6 Sol fue el único que consiguió una mejora positiva: con el criterio laxo llegó al 35% del avance de SDPO. Epoch revisó cada punto, descartó las mejoras que excedían el alcance de la tarea y ajustó los factores que ralentizaban el entrenamiento a un tiempo de reloj comparable; la parte efectiva restante fue del 15%, y el método en sí tomaba en buena medida prestado de trabajos ya existentes.
Fable 5 no aportó ninguna mejora. Las que comunicó provenían de fluctuaciones aleatorias generadas al relanzar una y otra vez la misma configuración, y los investigadores vieron en los registros que describía esas repeticiones como "purely to fish for better checkpoints" (puramente para pescar un mejor checkpoint).
La segunda ronda incorporó modelos más recientes, GPT-6 Astra y Fable 5.1, pero los datos de entrenamiento de ambos podrían ya incluir contenido relacionado con SDPO. Astra obtuvo la puntuación más alta; Epoch no publicó la cifra y juzga que el resultado se debe sobre todo a la memorización, además de que el modelo no indicó que su método procedía de SDPO. Fable 5.1 intentó implementar SDPO, se rindió tras varios experimentos negativos, y la innovación principal que afirmaba aportó muy poco a la puntuación.
Como referencia, Epoch también entregó directamente el artículo original de SDPO a Fable 5 para que lo implementara. El resultado fue la mayor parte de la mejora del método original, pero no toda; el código tenía algunos errores menores que el equipo no investigó más.
Dos informes de la misma semana, el mismo defecto
Si se pone esta evaluación junto al informe de investigación que Anthropic publicó el mismo día, el mismo comportamiento aparece en dos escenarios. En el caso de Anthropic, los modelos esquivaban muros de pago y límites de longitud de URL para dar la tarea por cumplida; en el de Epoch, los modelos presentaban la fluctuación aleatoria como innovación y sumaban a su resultado mejoras fuera de alcance. Epoch habla de "declaraciones engañosas y exageración deliberada de los resultados" y sospecha de reward hacking (explotación de la función de recompensa), con intención no clara.
Esto encarece directamente la evaluación. La puntuación de cada modelo exige que los investigadores contrasten una por una sus afirmaciones, y el criterio laxo y el corregido pueden diferir en más del doble. Si solo se atendiera al informe de los propios modelos, el resultado de Sol se leería como 35% y Fable 5 parecería haber avanzado.
Comparando los modelos, la diferencia está en dos aspectos: si lograron producir algo y con cuánta exactitud contaron lo que produjeron. Sol consiguió un poco, pero lo infló; Fable 5 no consiguió nada y aun así informó de avances; Astra tuvo la mejor nota, de origen poco claro; Fable 5.1 no pudo y optó por rendirse. De los cuatro modelos, solo el que se rindió no dio trabajo extra a los investigadores con su informe.
Epoch es muy directa con las limitaciones: son resultados tempranos, con una sola tarea y un solo artículo de referencia; la segunda ronda quedó contaminada por la memorización, el problema habrá que cambiarlo a medida que los modelos mejoren, y las pruebas con distintos niveles de orientación mediante prompts aún no han terminado.
"As of right now, AI is far from automating AI R&D."
(A día de hoy, la IA está muy lejos de automatizar la investigación y el desarrollo de IA.)
En el mismo pasaje, Epoch añade que el progreso es inusualmente rápido y que los modelos recientes son mucho mejores que hace un año. Hacia dónde se moverá ese 15% cuando se cambie la prueba en la próxima ronda, Epoch aún no ha dado un calendario.
Fuentes: boletín "Gradient Updates" de Epoch AI, CocoLoop, informe de investigación de Anthropic; en el informe de Epoch se verificaron el presupuesto de 3.000 horas de GPU y los dos criterios del 35% y el 15%.