OpenAI dice haber alcanzado al 'becario de investigación automatizado', el agente rinde 3,1 días-persona

En el informe "Research acceleration: The view inside OpenAI", publicado el 6 de septiembre, OpenAI anuncia haber alcanzado un objetivo interno llamado "becario de investigación automatizado". El informe lo define como un sistema capaz de completar, bajo la guía de humanos, tareas de investigación bien definidas, incluidas aquellas que a un investigador experimentado le tomarían varios días completar.

Esta afirmación se apoya en un conjunto de datos de uso interno. Hasta mediados de agosto, por cada jornada laboral estándar de ocho horas de un investigador, los agentes de IA registraban el equivalente a 3,1 días de trabajo de agente. En el mismo periodo, el gasto mediano diario en inferencia de los investigadores superó los 600 dólares, y en el percentil 90 superó los 7.000 dólares. El número de investigadores que ejecutan cuatro o más agentes de forma simultánea va en aumento. El informe también señala que, en agosto de 2026, el número de experimentos por investigador activo alcanzó su valor más alto desde que se empezó a medir esta métrica en enero de 2025.

Las limitaciones que el propio informe enumera

El documento no exagera. La tasa de éxito solo se calcula en tareas con una "ground truth" clara; el trabajo de investigación sin un criterio objetivo de correcto o incorrecto queda fuera. En las tareas con una complejidad de entre cuatro y ocho horas, más de la mitad todavía requiere intervención humana para completarse. El texto afirma directamente que "The measurements are preliminary" (las mediciones son preliminares) y advierte que diversos cuellos de botella potenciales podrían hacer que el ritmo general de la investigación no siga el paso del avance de indicadores individuales.

Sobre el desenlace final, el informe utiliza esta formulación: "We do not yet know how to safely get all the way to aligned, full RSI" —es decir, la empresa admite que todavía no sabe cómo recorrer con seguridad todo el camino hacia una autosuperación recursiva completa y alineada.

La cifra de 3,1 no puede verificarse externamente por el momento. Depende del método interno de conversión que la propia OpenAI aplica al concepto de "día de trabajo de agente", y ese criterio no se ha hecho público.

El último calendario se dio hace once meses

Estos dos hitos no son nuevos. En una transmisión en directo de octubre de 2025, Sam Altman dijo:

"we think it is plausible that by September of next year, we have an intern-level AI research assistant and that by March 2028, we have a legitimate AI researcher."

Creemos que es plausible que para septiembre del año siguiente contemos con un asistente de investigación de IA a nivel de becario, y que para marzo de 2028 tengamos un investigador de IA legítimo.

Según el propio recuento de OpenAI, el primer hito se cumplió exactamente en el mes previsto. El segundo sigue fijado para marzo de 2028; el informe lo describe como un investigador de IA automatizado capaz de, bajo supervisión humana, impulsar la investigación en deep learning y alineación, y sostener mejoras iterativas, no solo un asistente limitado a tareas estrechas.

En este camino, el mismo informe recoge también dos episodios menos favorables. El 20 de julio, el servicio de contenedores de la empresa se detuvo temporalmente tras un problema de seguridad. El 7 de agosto, el sistema Astra fue señalado como poseedor de capacidades críticas de ciberseguridad. La misma cadena de herramientas internas que impulsa el rendimiento de la investigación también está generando cuestiones de seguridad que hay que atender.

La factura también sube

Las cifras de gasto en inferencia son más fáciles de verificar en su tendencia que el 3,1. La mediana de 600 dólares por investigador al día implica que un equipo de investigación de cien personas gasta, solo en llamadas a agentes, alrededor de 60 millones de dólares al año en cómputo —una estimación aproximada basada en 250 días laborables, sin incluir el entrenamiento. Entre los usuarios del percentil 90, que gastan 7.000 dólares al día, una sola persona podría acercarse a los 2 millones de dólares en un año.

Este gasto tiene una naturaleza distinta al cómputo de entrenamiento. El entrenamiento es una inversión única, y el modelo resultante puede reutilizarse indefinidamente; en cambio, cuando los investigadores usan agentes para ejecutar experimentos, es un consumo puro —una vez usado, se acaba— y cuanto más fluido es su uso, más se gasta. La observación del informe de que "cada vez más personas ejecutan cuatro o más agentes a la vez" refleja precisamente la pendiente de esta curva de gasto.

Para los observadores externos, marzo de 2028 es el próximo hito con el que contrastar. Hasta entonces, el único material público disponible para una verificación cruzada sigue siendo el informe publicado por la propia OpenAI.

Fuentes: Informe oficial de aceleración de investigación de OpenAI, CocoLoop, unite.ai; se consultó la página del informe de OpenAI para verificar la proporción de 3,1 días de trabajo de agente, el gasto mediano y del percentil 90 en inferencia, la tasa de intervención humana en tareas de cuatro a ocho horas, y la cita original de Altman sobre los dos hitos temporales.