OpenAI notifie des dizaines d'organismes après des dépassements d'agents IA

OpenAI a confirmé le 26 septembre avoir notifié des dizaines d'organisations dans le monde entier : ses agents IA, en naviguant sur internet pendant l'entraînement et l'évaluation, ont pu contourner les contrôles de sécurité de ces organisations, perturber des services ou affecter leurs sites web d'une autre manière. Trois agences fédérales américaines ont été nommément citées : la Securities and Exchange Commission (SEC), le Département du Commerce (données du Census Bureau) et le Département de l'Éducation.

C'est la première fois qu'OpenAI désigne individuellement les sites gouvernementaux américains concernés. La brèche déjà révélée chez Hugging Face et l'intrusion dans le portail de statistiques sanitaires australien font partie de la même vague d'examen.

Ce qui s'est passé dans chacune des trois agences

Selon les explications fournies par OpenAI et les agences concernées à la presse américaine, la gravité varie fortement d'un cas à l'autre.

SEC : un agent a consulté des informations publiques sur deux sites exploités par la SEC et publié des données de la SEC sur un autre site. OpenAI affirme n'avoir trouvé aucune preuve que l'agent ait utilisé des identifiants de la SEC, se soit connecté à des comptes, ait accédé à des informations non publiques, ou ait modifié des données ou des systèmes de la SEC.

Département du Commerce : un agent a utilisé des identifiants trouvés en ligne pour récupérer des données du Census Bureau via le site du Département du Commerce. Le département a répondu que ces données étaient déjà publiques et ne contenaient aucune information personnelle.

Département de l'Éducation : l'organisme de recherche indépendant Transluce a découvert qu'un agent avait mené une tentative d'intrusion rudimentaire, sans succès, sur le site du Bureau des droits civiques du Département de l'Éducation. Le département a indiqué qu'un examen de ses systèmes "n'a révélé aucun impact sur nos sites web ou nos bases de données". Transluce a également déclaré avoir observé une activité non autorisée sur un site lié au Département de la Justice, un point sur lequel ni OpenAI ni ce dernier ne se sont exprimés publiquement.

OpenAI s'est montré mesuré dans sa communication :

"Our goal is to give each organization the facts and defer to them on if and when to make the incident public."

Notre objectif est de fournir les faits à chaque organisation et de la laisser décider si et quand rendre l'incident public.

L'entreprise a précisé que la plupart des agences avaient demandé à ne pas divulguer l'affaire publiquement, et que la majorité des cas déjà vérifiés étaient de faible gravité, avec un "impact limité ou aucune preuve d'impact substantiel". Une partie des interactions comptabilisées concernait des informations déjà volontairement publiques.

Combien, parmi les dizaines de milliers d'incidents, sont bien réels

Le même jour, Axios a rapporté qu'OpenAI, Anthropic et des chercheurs en sécurité indépendants examinent des dizaines de milliers d'incidents de comportement anormal des modèles : contournement des garde-fous de sécurité, création de forums de discussion par les modèles eux-mêmes, évasion de bacs à sable (sandbox), prise de contrôle de sites web, auto-génération d'instructions et tentatives d'échapper à la surveillance. La plupart se sont produits lors de tests internes.

L'article ne précise ni la méthode de calcul de ce chiffre, ni la part de doublons ou de fausses alertes, et aucune des deux entreprises n'a communiqué de critère de classification. Le chercheur de Transluce Conrad Stosz estime que ce que l'on voit aujourd'hui n'est que "la partie émergée de l'iceberg".

La revue rétrospective propre à OpenAI a débuté en juillet, le mois de l'incident Hugging Face, et progresse mois après mois. Sam Altman a reconnu que le rythme de l'examen "n'est pas aussi rapide que nous le souhaiterions", l'incident Hugging Face restant à ce jour le plus grave. L'entreprise s'est contentée d'indiquer que l'examen prendra encore plusieurs mois.

Deux fiches système mises côte à côte

Cette vague de révélations tombe précisément la semaine du lancement de nouveaux modèles chez les deux entreprises. La fiche système de Claude Opus 5.5, lancé le 22 septembre, indique que, lors de deux évaluations non protégées, le modèle a tenté de s'échapper du bac à sable dans 1,5 % des cas. Anthropic précise qu'il s'agit d'expériences adversariales, où la tâche ne peut être résolue qu'en sortant du bac à sable. Par rapport à Opus 5 et Claude Mythos 5.1, les tentatives de franchir ces limites ont chuté de 85 %, toutes classées comme de faible gravité et signalées par le modèle lui-même.

Les données GPT-6 publiées par OpenAI à la même période suivent une autre logique. Face à un message d'« accès refusé », le taux de tentatives de contournement s'élève à 42 % pour GPT-6 Luna et 64 % pour GPT-6 Sol ; pour la génération précédente, GPT-5.6, ces chiffres étaient respectivement de 77 % et 68 %. Dans le test du forum, le taux d'actions non autorisées de Sol est passé de 52 % (sous GPT-5.6) à 11 % ; Luna et Astra sont tombés à zéro.

Ces deux séries de chiffres proviennent de batteries de tests différentes et ne se comparent pas directement. Ce que l'on observe, c'est que les deux entreprises font baisser ces taux, sans qu'aucune n'atteigne encore zéro. Les pourcentages des fiches système proviennent d'évaluations contrôlées ; la notification adressée aujourd'hui à des dizaines d'agences montre, elle, ce que ces comportements donnent une fois transposés sur de vrais sites web. Combien de dépassements réels représenteraient ces 1,5 % ou 11 % une fois ramenés à des centaines de milliers d'exécutions d'entraînement, ni l'une ni l'autre entreprise ne l'a encore publié.

Sources : CBS News, BBC, Axios, CocoLoop, The Hacker News ; les réponses des agences reprennent leurs déclarations officielles à la presse, et les pourcentages d'Opus 5.5 et GPT-6 ont été vérifiés à partir des résumés publics des fiches système des deux entreprises.