OpenAI ajoute un filigrane invisible aux textes de ChatGPT dans l'UE

Le 5 octobre, OpenAI a présenté un système de filigrane textuel baptisé textGrain, destiné à répondre aux exigences de transparence de l'article 50 de la loi européenne sur l'intelligence artificielle. Dans les prochaines semaines, les utilisateurs éligibles de ChatGPT et de Codex dans l'UE recevront des textes rédigés par le modèle portant une couche de signal statistique invisible à l'œil nu mais identifiable par une machine.

Les clients API du monde entier pourront aussi activer manuellement cette fonction pour certains modèles à partir du jour de l'annonce, désactivée par défaut. L'annonce ne précise pas quels modèles sont concernés.

Le filigrane se cache dans le choix des mots

textGrain agit au moment où le modèle choisit ses mots. Lors de la génération de texte, à de nombreux endroits, plusieurs mots candidats sont également appropriés, et OpenAI utilise une clé pour décider lequel est retenu. Une seule phrase ne présente rien d'inhabituel, mais si le passage est assez long, les mots favorisés par la clé apparaissent assez souvent pour devenir statistiquement reconnaissables — celui qui détient la clé peut alors déterminer si le texte provient d'un modèle filigrané.

Les données de détection fournies par OpenAI reposent sur un taux de faux positifs de 1 % :

  • Passage de 200 tokens : taux de détection d'environ 80 % ;
  • 400 tokens : environ 95 % ;
  • Passage de 400 tokens avec 10 % des mots remplacés par des synonymes : la détection chute à 66 % ;
  • Avec 25 % de mots remplacés : il ne reste que 17 %.

En d'autres termes, si un lecteur reçoit un texte généré par ChatGPT et le reformule légèrement, le filigrane devient pratiquement impossible à reconnaître. OpenAI n'évite pas ce point dans sa documentation.

Sur le plan de la qualité, l'entreprise affirme que, sur huit benchmarks, l'écart de score entre filigrane activé et désactivé reste dans la marge de bruit statistique ; sur l'un d'eux, les scores étaient de 49,57 contre 49,76.

Le détecteur reste fermé au public

La partie la plus restreinte de ce système concerne la détection. OpenAI a ouvert le même jour un canal de demande, mais le détecteur n'est accessible qu'aux "chercheurs et institutions spécialisées approuvés", avec une validation au cas par cas. Les utilisateurs ordinaires, les écoles et les éditeurs ne peuvent pas encore vérifier eux-mêmes un texte.

OpenAI délimite aussi clairement les limites de l'outil dans sa documentation :

"A watermark does not measure human contribution, does not establish ownership or responsibility, does not identify the user, and does not verify accuracy."

(Un filigrane ne mesure pas la contribution humaine, n'établit ni la propriété ni la responsabilité, n'identifie pas l'utilisateur et ne vérifie pas l'exactitude du contenu.)

L'entreprise rappelle également que l'absence de filigrane détecté ne prouve pas qu'un texte a été écrit par un humain.

Calendrier réglementaire

L'article 50 de la loi européenne sur l'IA oblige les fournisseurs d'IA générative à rendre leurs contenus identifiables par une machine comme étant générés par l'IA. Selon le calendrier publié, cette disposition s'applique depuis le 2 août, avec une période de grâce jusqu'au 2 décembre pour les systèmes déjà en service auparavant. OpenAI a choisi de déployer la fonction dans l'UE "dans les prochaines semaines", ce qui correspond à peu près à cette fenêtre.

Cela explique aussi pourquoi le filigrane n'est activé par défaut que dans l'UE. Dans les autres régions, les sorties de ChatGPT et de Codex restent pour l'instant sans filigrane ; les utilisateurs d'API peuvent l'activer eux-mêmes s'ils le souhaitent.

Plusieurs acteurs sur la même voie

Le filigrane textuel est une voie qui, au cours de l'année écoulée, a déjà attiré plusieurs entreprises.

Google DeepMind, avec SynthID, a été le premier à proposer un filigrane textuel, selon le même principe consistant à biaiser le choix des mots lors de l'échantillonnage, avant d'en ouvrir la partie texte en open source ; fin septembre, DeepMind a appliqué la même idée à des séquences de protéines conçues par IA. Des médias étrangers rapportent qu'OpenAI estime elle-même que les performances de textGrain sont équivalentes, voire légèrement supérieures, à celles de SynthID — une affirmation qui n'a pas encore été vérifiée de façon indépendante.

Anthropic a annoncé en août un filigrane pour les sorties textuelles de Claude, avec une approche similaire et le même problème récurrent : la réécriture annule son effet. Le framework d'inférence vLLM a transformé en septembre un filigrane textuel basé sur l'échantillonnage de Gumbel en option intégrée ; les tests montrent qu'en écriture créative, une centaine de tokens suffit pour une détection totale, tandis que pour les tâches de code, seuls 43 % sont détectés même à 400 tokens.

En mettant ces chiffres côte à côte, la tendance commune est claire : plus un texte est long et "librement rédigé", plus le filigrane est facile à reconnaître ; pour le code, les formules ou les réponses factuelles très déterministes, la marge de manœuvre pour biaiser le choix des mots est faible, et le signal y est donc naturellement plus faible. Les chiffres publiés par textGrain concernent des textes généraux ; OpenAI n'a pas communiqué de chiffres distincts pour le cas du code.

Pour les utilisateurs en Chine, ce changement a pour l'instant peu d'impact : le filigrane n'est activé par défaut que dans l'UE, et ChatGPT n'est déjà pas directement accessible en Chine. Les "Mesures d'étiquetage des contenus synthétiques générés par IA" chinoises, en vigueur depuis septembre de l'année dernière, exigent une combinaison d'étiquetage explicite et d'étiquetage implicite dans les métadonnées, selon une approche différente.

Sources : Déclaration de transparence textuelle d'OpenAI pour l'UE, AI Weekly, CocoLoop, Analyse technique de CellCog ; les taux de détection reposent sur un taux de faux positifs de 1 %, et la date d'application de la loi suit le calendrier publié par l'UE.