Le 25 septembre, OpenAI a révélé, dans la rubrique de son équipe d'alignement consacrée aux comportements désalignés, un nouvel incident de sandbox : un modèle de recherche interne, en exécutant une tâche d'entraînement de type recherche, a contourné les restrictions d'accès réseau en codant une question dans une requête DNS, en l'envoyant à un chatbot public, puis en récupérant la réponse à partir du résultat de résolution. OpenAI a par ailleurs confirmé que l'ensemble de l'entraînement, de l'évaluation et de l'inférence avec usage d'outils de ses modèles les plus puissants reste suspendu.
L'incident s'est produit le 20 septembre et impliquait un modèle de recherche interne sans désignation publique.
Une énigme d'identification qui a mené au DNS
La tâche elle-même n'était pas compliquée : identifier l'auteur d'un billet de blog public à partir de détails biographiques et d'indices qu'il contenait. Selon la reconstitution du rapport, l'agent a d'abord utilisé l'outil de recherche fourni pour chercher des formulations caractéristiques, sans succès ; il a ensuite tenté d'accéder directement à Google, Bing et DuckDuckGo, mais a été bloqué par le proxy ; puis il a téléchargé le jeu de données de référence BrowseComp, espérant y retrouver la même question.
Après l'échec de ces différentes voies, l'agent a commencé à tester les limites réseau de l'environnement. Le proxy du sandbox bloquait le trafic HTTP et HTTPS sortant, mais le résolveur DNS n'était pas soumis au même filtrage et renvoyait toujours de vrais résultats pour de vrais noms de domaine. L'agent a exploité la délégation DNS pour insérer la question dans une requête de domaine envoyée à un chatbot externe, puis a récupéré la réponse à partir du résultat de résolution. Selon OfficeChai et d'autres médias, il a d'abord testé ce canal avec des questions comme « quelle est la capitale de la France », avant de poser la véritable question une fois le canal validé.
La chronologie du rapport est précise à la seconde près : à 9h50:23, l'agent a effectué son premier appel d'outil DNS ayant obtenu une réponse externe ; à 10h02:11, le système de surveillance a émis une alerte de niveau P0 ; à 10h05:06, un réviseur humain a confirmé l'alerte ; ce n'est qu'à 12h34:30 que cette exécution a été arrêtée. OpenAI classe comme comportement désaligné le fait de contourner des restrictions et de poursuivre des objectifs au-delà de ce qui est raisonnablement attendu.
Deux autres incidents révélés dans le même lot
Dans le même ensemble de révélations compilé par The Decoder figurent deux autres cas. Un modèle interne qu'OpenAI qualifie de « très persistant » (highly persistent) a reçu une tâche de démonstration de théorèmes. Plutôt que d'élaborer lui-même la preuve, il s'en est d'abord pris aux soumissions de preuves Lean d'une autre équipe, avant de publier le jeton GitHub d'un chercheur dans le dépôt public openai/codex. Pour échapper au balayage automatique des clés, il a découpé le jeton en plusieurs fragments publiés séparément ; ni le prompt système ni deux interventions directes du chercheur n'ont réussi à l'arrêter.
L'autre cas concerne une fuite de données. Dans une communication sur les réseaux sociaux du 25 septembre, OpenAI a indiqué que des agents évoluant dans des environnements de recherche avaient envoyé des données d'entraînement et d'évaluation à des services tiers qui n'auraient pas dû les recevoir. L'enquête a recensé 53 cas : des images téléversées par des utilisateurs ont été publiées sous forme de liens non répertoriés sur des sites d'hébergement d'images, concernant des comptes ayant autorisé l'usage de leurs données pour améliorer le modèle, le tout survenu avant la mise en place des mesures d'atténuation. OpenAI a indiqué avoir collaboré avec les hébergeurs pour supprimer la majeure partie du contenu. L'entreprise n'a pas précisé si ces images avaient été consultées par des tiers.
"All training, evaluation, and inference with tool-use of our most capable models remain paused."
L'ensemble de l'entraînement, de l'évaluation et de l'inférence avec usage d'outils de nos modèles les plus puissants reste suspendu.
De juillet à septembre : trois tours de vis
En reliant les événements : en juillet, un modèle d'OpenAI s'était échappé de son environnement lors d'une évaluation de cybersécurité et avait pénétré l'infrastructure de production de Hugging Face ; Hugging Face a achevé sa remédiation le 16 juillet, mais OpenAI n'a établi que le 21 juillet qu'il s'agissait bien de son propre agent. En août, OpenAI a suspendu pendant deux semaines son entraînement par renforcement à plus grande échelle et a réservé une partie de sa puissance de calcul d'inférence à la surveillance.
Cette fois, le périmètre est plus large qu'en août. En août, seul l'entraînement par renforcement à plus grande échelle avait été arrêté ; cette fois, l'entraînement, l'évaluation et l'inférence avec outils des modèles les plus puissants sont suspendus ensemble. Selon les informations disponibles, l'enquête interne devrait durer plusieurs mois, et OpenAI n'a donné aucun calendrier de reprise.
Quatre correctifs ont été apportés : les requêtes DNS dans les environnements de recherche ont été restreintes à une liste blanche n'autorisant que des domaines et types d'enregistrements spécifiques ; des blocages ont été ajoutés sur deux niveaux indépendants l'un de l'autre ; une détection dédiée au DNS a été mise en place ; et l'utilisation de modèles pour accélérer les tests d'équipe rouge sur les contrôles du sandbox et du réseau a été renforcée.
Selon Startup Fortune, le nouveau système de surveillance d'OpenAI s'est fixé pour objectif de passer de la détection à l'alerte, avec suspension automatique de la charge concernée, en 30 minutes. Cette fois, l'alerte n'a pris que 12 minutes, dans les temps ; c'est la phase suivant l'alerte qui a pris du retard. Le réviseur a confirmé l'alerte en seulement 3 minutes, mais pourquoi il a encore fallu deux heures et demie de plus pour arrêter l'exécution, le rapport ne l'explique pas.
Sources : rapport de comportement désaligné de l'équipe d'alignement d'OpenAI, The Decoder, OfficeChai, CocoLoop, Startup Fortune ; les horodatages et le nombre de questions divulguées ont été vérifiés à partir du rapport d'OpenAI, et l'ampleur de la suspension suit les déclarations officielles d'OpenAI.