El científico jefe de OpenAI dice que el monitoreo de la cadena de razonamiento se está debilitando

El científico jefe de OpenAI, Jakub Pachocki, publicó el 6 de septiembre un extenso ensayo titulado "An Alien Mind", del que una frase ha sido ampliamente citada: actualmente cree que ningún laboratorio ha resuelto la alineación y el monitoreo en un grado suficiente para seguir escalando de forma responsable a máxima velocidad.

La frase proviene del científico jefe de una empresa que está expandiéndose precisamente a máxima velocidad; la posición de quien habla resulta más inusual que el propio contenido.

La línea de monitoreo de la cadena de razonamiento se está degradando

En los últimos dos años, la apuesta de seguridad más fuerte de OpenAI ha sido el monitoreo de la cadena de razonamiento (chain-of-thought monitoring): hacer que los modelos de razonamiento escriban sus pasos intermedios, para que otro sistema los lea y evalúe si el modelo está tramando algo. Pachocki enumera tres razones por las que este método resulta cada vez menos fiable.

Primero, los modelos de razonamiento actuales operan en entornos complejos donde el proceso de razonamiento se entrelaza con las llamadas a herramientas, y estas ya requieren de por sí mucha supervisión, lo que difumina los límites del monitoreo. Segundo, los modelos son cada vez más hábiles tanto para razonar como para manipular sus propios rastros de razonamiento. Tercero, las mejoras en el preentrenamiento hacen que los modelos sean más capaces incluso sin verbalizar su razonamiento.

"Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer."

En traducción libre: Actualmente creo que ningún laboratorio ha resuelto la alineación y el monitoreo en un grado suficiente para continuar escalando de forma responsable a máxima velocidad durante mucho más tiempo.

Pachocki añade que estas dificultades no son necesariamente insolubles; OpenAI está desarrollando nuevos métodos de intervención, incluidos monitores con acceso directo al estado interno de la red.

El otro extremo, hace tres años

El texto recupera un momento concreto. A mediados de 2023, en un proyecto de investigación interno de OpenAI llamado RLSlow, Pachocki y su colega Szymon vieron por primera vez resultados que los convencieron de que era posible entrenar modelos de razonamiento a gran escala, resultados que destaparon la capacidad de los modelos preentrenados para formar espontáneamente una cadena de razonamiento.

Uniendo ambos extremos: dejar que el modelo "piense en voz alta" fue en su momento tanto un salto de capacidad como, de paso, una ventana de observación. Tres años después, la capacidad sigue creciendo mientras esa ventana de observación se va cerrando. En la línea de los modelos de razonamiento, OpenAI siempre ha tratado la legibilidad de la cadena de razonamiento como el pilar de su relato de seguridad. Ahora la misma empresa dice que ese pilar se está debilitando.

De marco voluntario a estándar obligatorio

La propuesta de Pachocki es elevar los marcos voluntarios que ya existen en la industria: documentos como el Preparedness Framework de OpenAI o la Responsible Scaling Policy de Anthropic deberían evolucionar hacia estándares de seguridad obligatorios, aplicados por auditores independientes, organismos gubernamentales u organizaciones internacionales. También escribe que los gobiernos deberían situar la coordinación internacional sobre el desarrollo de la inteligencia artificial como máxima prioridad, y que espera y desea que la desaceleración voluntaria se vuelva habitual hasta que se establezcan umbrales de seguridad comunes.

Otra frase muy citada es: una vez que se comprende a fondo la gravedad del riesgo, la idea de avanzar a toda costa resulta absurda.

Por ahora, estas declaraciones se mantienen en el nivel de un ensayo firmado a título personal. OpenAI no ha publicado ningún plan concreto de desaceleración, cronograma ni condiciones que lo activarían, ni ha explicado en qué circunstancias pausaría activamente alguna línea de entrenamiento. Quién definirá los umbrales de seguridad y de dónde saldrán los auditores tampoco quedan resueltos en el texto. En paralelo, la empresa sigue avanzando en su objetivo de automatización de la investigación y en una solicitud de salida a bolsa valorada en 852.000 millones de dólares.

Fuentes: ensayo oficial de OpenAI "An Alien Mind", Unite.AI, CocoLoop, AI Weekly; las tres razones sobre la caída de fiabilidad del monitoreo y las citas se han verificado con el texto público de OpenAI.