OpenAI affirme que des comptes liés à Moonshot AI ont distillé des chaînes de raisonnement

Le 30 septembre, OpenAI a publié un billet affirmant avoir identifié et démantelé une opération organisée de distillation de modèles, visant à extraire le contenu de raisonnement protégé de ses modèles de raisonnement. OpenAI a attribué l'activité d'un « cluster central » à des personnes travaillant pour Moonshot AI. Moonshot AI n'a pas répondu à la demande de commentaire de CyberScoop.

Du 1er au 28 juillet

Selon la chronologie publiée par OpenAI :

  • Le 1er juillet, une activité suspecte de faible intensité a été détectée, puis a progressivement augmenté ;
  • Les 24 et 25 juillet, environ 4 000 utilisateurs ont envoyé quelque 16 000 prompts correspondant au même schéma d'extraction ;
  • Le 28 juillet, le nombre d'utilisateurs suspects est passé à environ 15 000, et OpenAI affirme avoir « complètement démantelé » l'opération ce jour-là.

Sur le mode opératoire, OpenAI indique que les auteurs n'ont ni cassé le chiffrement, ni compromis de bases de données, ni obtenu de conversations d'utilisateurs stockées. Ce qu'ils ont fait, c'est manipuler les interactions avec le modèle pour que du contenu de raisonnement censé rester caché soit restitué sous une forme visible par le demandeur. CyberScoop a qualifié l'une des techniques de « nouveau contournement du chiffrement » : copier des données de raisonnement chiffrées issues d'une session, puis les faire déchiffrer et retranscrire en clair par le modèle dans une autre session.

« They manipulated model interactions so that protected reasoning could be reproduced in forms visible to the requester. » (Ils ont manipulé les interactions avec le modèle pour que le raisonnement protégé puisse être reproduit sous une forme visible par le demandeur.)

Les mesures prises par OpenAI incluent le bannissement de comptes, un renforcement des contrôles à l'inscription et sur l'infrastructure, une surveillance réseau élargie, ainsi que la correction de la faille permettant le déchiffrement entre sessions. Les découvertes ont été partagées via le Frontier Model Forum et des canaux gouvernementaux. Selon OpenAI, le contenu de raisonnement extrait pourrait servir à entraîner des modèles dérivés dépourvus des protections de sécurité du modèle d'origine, ce qui représente des risques tant pour la sécurité que pour la sécurité nationale.

L'attribution tient en une seule phrase

CyberScoop souligne que le billet d'OpenAI ne fournit ni preuve technique ni raisonnement justifiant l'attribution de cette activité à Moonshot AI. La formulation employée est « des personnes travaillant pour le compte de Moonshot AI », sans préciser s'il s'agit d'un comportement individuel ou orchestré par l'entreprise. Avec les éléments publics actuellement disponibles, il est impossible de vérifier cette attribution de manière indépendante.

Ces derniers mois, des responsables américains ont déjà accusé publiquement, à plusieurs reprises, des entreprises chinoises de distiller des modèles américains, et le conseiller scientifique de la Maison-Blanche a tenu des propos similaires. La différence, cette fois, est qu'OpenAI a fourni des dates précises, un nombre d'utilisateurs et une méthode d'attaque, tout en citant nommément dans le texte une entreprise chinoise valorisée à plusieurs dizaines de milliards de dollars.

Une autre information de la même semaine

La semaine même où ces accusations ont été rendues publiques, Kimi K3 venait d'entrer dans le canal de vente entreprise d'OpenAI. Le fournisseur américain d'inférence Baseten héberge Kimi K3, et les clients entreprise peuvent l'appeler directement dans Codex, les dépenses étant imputées aux engagements d'achat déjà signés avec OpenAI, sans contrat fournisseur distinct à signer. C'est considéré comme la première fois qu'un modèle open source chinois entre dans le système de facturation entreprise d'OpenAI. Philip Kiely, de Baseten, a écrit que les équipes entreprise peuvent désormais utiliser nativement dans Codex des modèles open source comme GLM-5.3 Flash et Kimi K3. Tibo, responsable de Codex, en republiant l'information, s'est contenté d'écrire : « Open is the way. »

Pour les entreprises chinoises de modèles et ceux qui les observent, les deux informations prises ensemble en disent plus. Les poids ouverts permettent à Kimi K3 de contourner les barrières à l'exportation et aux achats, hébergé par une entreprise américaine puis vendu à des entreprises américaines ; cette même entreprise est désignée par OpenAI comme partie liée à l'opération de distillation. Reste à savoir si les clients étrangers devront désormais passer par un contrôle de conformité supplémentaire lors de leurs achats, ce qui dépendra de la publication éventuelle de preuves supplémentaires.

OpenAI n'a pas précisé si cette accusation affecte l'approvisionnement de Kimi K3 dans Codex ; ni Baseten ni Moonshot AI ne se sont exprimés à ce sujet.

Sources : blog officiel d'OpenAI, CyberScoop, TechNode, CocoLoop ; le nombre d'utilisateurs suspects et de prompts correspond aux chiffres communiqués par OpenAI, et le mode de facturation du canal entreprise de Codex correspond aux déclarations de Baseten.