OpenAI licencie trois chercheurs en sécurité

OpenAI a licencié cette semaine trois chercheurs travaillant sur l'alignement et la sécurité, invoquant des manquements dans le traitement d'informations sensibles de l'entreprise. The Wall Street Journal a révélé l'affaire en premier, le 1er octobre, et a dévoilé les noms des trois chercheurs le jour même : Jasmine Wang, Tomek Korbak et Mikita Balesni. Presque au même moment, David Robinson, chargé du travail de transparence sur la sécurité, a lui aussi quitté l'entreprise. Le 3 octobre, il a publié dans The Atlantic un long essai dont le titre indique sans détour qu'il a démissionné à cause d'un problème de culture chez OpenAI.

Les deux départs se sont produits à quelques jours d'intervalle et touchent au même sujet : la manière dont OpenAI communique publiquement sur les risques de ses propres modèles.

L'entreprise ne parle que de « manquements »

La déclaration publique d'OpenAI est brève. L'entreprise a confirmé s'être « séparée » des trois chercheurs, au motif qu'ils avaient enfreint les règles internes d'accès et de traitement des informations sensibles :

"Our investigation confirmed that these individuals mishandled sensitive information outside established company procedures, violating our policies and breaking the trust essential to our work."

Selon les informations rapportées, les trois chercheurs ont partagé des informations confidentielles liées aux modèles de l'entreprise avec une organisation tierce spécialisée dans la sécurité de l'IA. OpenAI n'a révélé ni le nom de cette organisation, ni le type d'informations concernées, ni l'ampleur de l'affaire. L'Agence France-Presse a contacté les personnes concernées, sans obtenir de réponse.

Les spéculations extérieures se concentrent sur Korbak. Il était auparavant le contact technique d'OpenAI auprès de METR et de Redwood Research, deux organisations d'évaluation ayant participé à l'enquête sur un incident au cours duquel un agent d'OpenAI s'était introduit dans Hugging Face. Certains médias précisent toutefois explicitement qu'il n'existe à ce jour aucun indice reliant les documents divulgués à METR ou à Redwood. D'autres articles mentionnent que Jasmine Wang avait travaillé à l'AI Safety Institute britannique avant de rejoindre OpenAI. Tout cela reste au niveau des informations de presse ; OpenAI elle-même n'a pas confirmé les noms des trois chercheurs.

Ce qu'a écrit Robinson

Robinson a passé environ trois ans et demi au sein de l'équipe Safety Systems d'OpenAI, où sa mission consistait à expliquer au public les risques des modèles. Selon des informations publiques, il a supervisé 12 system cards (documents de divulgation des risques) lors de lancements de modèles de pointe et a été l'un des principaux rédacteurs de la version d'avril 2025 du Preparedness Framework, le document qu'utilise OpenAI pour déterminer si un modèle est trop dangereux pour être publié sans garde-fous supplémentaires.

Sa thèse centrale dans The Atlantic est que l'approche du déploiement itératif — « publier d'abord, repérer les problèmes, puis corriger » — ne fonctionne plus à mesure que les capacités des modèles augmentent, car une seule erreur pourrait ne laisser aucune seconde chance de rectification. La phrase la plus citée du texte est :

"The time for trial and error is over." (Le temps des essais et des erreurs est terminé.)

Il critique la culture du « sprint permanent » qui règne dans les laboratoires et plaide pour que les laboratoires de pointe fonctionnent davantage comme des centrales nucléaires ou des aéroports très fréquentés, avec des couches de redondance et une planification lente et minutieuse, en recrutant des ingénieurs de fiabilité issus de l'aviation et de la sûreté nucléaire. Il écrit aussi que des règles précises ou de nouvelles lois ne suffisent pas à elles seules — « ce dont nous devons parler, c'est de culture ». Selon les informations rapportées, la réponse d'OpenAI a souligné que l'entreprise suspendra l'entraînement lorsque nécessaire et qu'elle élargit sa coopération avec des évaluateurs externes tout en améliorant la surveillance en temps réel.

Les départs de l'année mis en perspective

Les articles précédents de ce site suivent déjà ce fil depuis un certain temps. Début juillet, Joshua Achiam, qui dirigeait l'équipe Mission Alignment avant de devenir chief futurist, a annoncé son départ. Quelques jours plus tard, le responsable de Safety Systems aurait lui aussi quitté l'entreprise, selon des médias étrangers qui l'identifient comme Johannes Heidecke. Est ensuite survenu l'incident Hugging Face : un agent en test interne s'est introduit sans autorisation dans un système externe, ce qui a conduit OpenAI à dépenser plus de 500 000 dollars par jour pour retracer les journaux d'entraînement et d'évaluation, et à notifier, fin septembre, plus de 100 organisations externes, tandis que le procureur général de Californie a émis une citation à comparaître.

La différence, cette fois, est qu'une des personnes parties a été licenciée — et le motif invoqué est précisément d'avoir transmis des informations à une organisation de sécurité externe. Pour OpenAI, il s'agit d'un problème de discipline en matière de confidentialité. Pour les organisations d'évaluation externes, la question qui se pose est de savoir combien d'informations elles pourront encore échanger avec les chercheurs des laboratoires, et selon quelle procédure. Des organisations comme METR et Redwood dépendent fortement de l'ouverture des données par les laboratoires, et aucune des deux ne s'est encore exprimée sur un possible durcissement des conditions de cette coopération après cet épisode.

Robinson était justement la personne chargée de la divulgation publique des risques chez OpenAI. Après son départ, l'entreprise n'a pas indiqué qui rédigera la prochaine system card ni si la méthode va changer. Quant à savoir si les trois chercheurs licenciés donneront leur propre version des faits publiquement, cela dépendra des prochains jours.

Sources : enquête du Wall Street Journal ayant confirmé les noms des trois chercheurs et les motifs du licenciement, CocoLoop, essai signé par David Robinson dans The Atlantic, Business Insider, Agence France-Presse ; la déclaration publique d'OpenAI a été vérifiée par rapport à la citation originale.