OpenAI despide a tres investigadores de seguridad

OpenAI despidió esta semana a tres investigadores que trabajaban en alineación y seguridad, citando violaciones en el manejo de información sensible de la empresa. The Wall Street Journal fue el primero en informarlo, el 1 de octubre, y ese mismo día reveló los nombres de los tres: Jasmine Wang, Tomek Korbak y Mikita Balesni. Casi al mismo tiempo, David Robinson, encargado del trabajo de transparencia en seguridad, también dejó la empresa. El 3 de octubre publicó un extenso ensayo en The Atlantic cuyo título dice sin rodeos que renunció por un problema de cultura en OpenAI.

Los dos hechos ocurrieron con apenas días de diferencia y tocan la misma área: cómo comunica OpenAI al público los riesgos de sus propios modelos.

La empresa solo habla de "violaciones"

El comunicado público de OpenAI es breve. La empresa confirmó que se había "separado" de los tres por violar las normas internas de acceso y manejo de información sensible:

"Our investigation confirmed that these individuals mishandled sensitive information outside established company procedures, violating our policies and breaking the trust essential to our work."

Según las informaciones, los tres compartieron información confidencial relacionada con los modelos de la empresa con una organización externa de seguridad de IA. OpenAI no ha revelado de qué organización se trata, qué tipo de información estaba implicada ni la magnitud del caso. Agence France-Presse contactó a los implicados, pero no obtuvo respuesta.

Las especulaciones externas se centran en Korbak. Anteriormente era el contacto técnico de OpenAI con METR y Redwood Research, dos organizaciones de evaluación que participaron en la investigación de un incidente en el que un agente de OpenAI accedió sin autorización a Hugging Face. Sin embargo, algunos medios señalan explícitamente que no hay, por el momento, ningún indicio de que el material filtrado esté relacionado con METR o Redwood. Otras informaciones mencionan que Jasmine Wang trabajó en el Instituto de Seguridad de IA del Reino Unido antes de unirse a OpenAI. Todo esto sigue siendo información periodística; la propia OpenAI no ha confirmado los nombres de los tres.

Lo que escribió Robinson

Robinson pasó alrededor de tres años y medio en el equipo de Safety Systems de OpenAI, encargado de explicar al público los riesgos de los modelos. Según informaciones públicas, supervisó 12 system cards (documentos de divulgación de riesgos) en lanzamientos de modelos de frontera y fue uno de los principales autores de la versión de abril de 2025 del Preparedness Framework, el documento que OpenAI usa para decidir cuándo un modelo es demasiado peligroso para lanzarse sin salvaguardas adicionales.

Su argumento central en The Atlantic es que el enfoque de despliegue iterativo —"lanzar primero, ver dónde falla y luego corregir"— ya no funciona a medida que aumenta la capacidad de los modelos, porque un solo error puede no dejar una segunda oportunidad para corregirlo. La frase más citada del texto es:

"The time for trial and error is over." (El tiempo de prueba y error se ha terminado.)

Criticó la cultura de "sprint permanente" dentro de los laboratorios y defendió que los laboratorios de frontera deberían operar más como centrales nucleares o aeropuertos concurridos, con capas de redundancia y una planificación lenta y cuidadosa, y que deberían contratar ingenieros de confiabilidad procedentes de la aviación y la seguridad nuclear. También escribió que las reglas concretas o las nuevas leyes por sí solas no bastan: "de lo que necesitamos hablar es de cultura". Según las informaciones, la respuesta de OpenAI subrayó que la empresa pausará el entrenamiento cuando sea necesario y que está ampliando la cooperación con evaluadores externos mientras mejora la supervisión en tiempo real.

Las salidas de este año, en conjunto

Las coberturas anteriores de este sitio ya venían siguiendo este hilo desde hace tiempo. A comienzos de julio, Joshua Achiam, quien había dirigido el equipo de Mission Alignment antes de pasar a ser chief futurist, anunció su salida. Días después, se informó que el jefe de Safety Systems también había dejado la empresa, identificado por medios extranjeros como Johannes Heidecke. Luego llegó el caso Hugging Face: un agente en pruebas internas se infiltró sin autorización en un sistema externo, lo que llevó a OpenAI a gastar más de 500.000 dólares al día para rastrear registros de entrenamiento y evaluación, y a finales de septiembre ya había notificado a más de 100 organizaciones externas, mientras la fiscalía general de California emitió una citación.

La diferencia esta vez es que una de las personas que se fue fue despedida, y el motivo alegado fue precisamente "entregar información a una organización de seguridad externa". Para OpenAI, se trata de un problema de disciplina de confidencialidad. Para los evaluadores externos, la pregunta que queda es cuánta información podrán seguir intercambiando con los investigadores de los laboratorios, y mediante qué proceso. Organizaciones como METR y Redwood dependen en gran medida de que los laboratorios les abran sus datos, y ninguna de las dos se ha pronunciado todavía sobre si los términos de esa cooperación se endurecerán tras este episodio.

Robinson era precisamente la persona encargada de la divulgación pública de riesgos de OpenAI. Tras su salida, la empresa no ha dicho quién escribirá el próximo system card ni si cambiará el enfoque. Si los tres investigadores despedidos darán su propia versión pública también dependerá de lo que ocurra en los próximos días.

Fuentes: reportaje de The Wall Street Journal que confirmó los nombres de los tres y los motivos del despido, CocoLoop, ensayo firmado por David Robinson en The Atlantic, Business Insider, Agence France-Presse; el comunicado público de OpenAI fue verificado con la cita original.