OpenAI versieht ChatGPT-Texte in der EU mit unsichtbarem Wasserzeichen

OpenAI hat am 5. Oktober ein Text-Wasserzeichen-System namens textGrain vorgestellt, das die Transparenzpflichten aus Artikel 50 des EU-KI-Gesetzes erfüllen soll. In den kommenden Wochen erhalten berechtigte ChatGPT- und Codex-Nutzer in der EU von den Modellen geschriebenen Text automatisch mit einer für das Auge unsichtbaren, maschinell erkennbaren statistischen Signatur.

API-Kunden weltweit können die Funktion ab dem Ankündigungstag für einzelne Modelle manuell aktivieren, standardmäßig ist sie deaktiviert. Welche Modelle die Funktion unterstützen, nennt die Ankündigung nicht.

Das Wasserzeichen steckt in der Wortwahl

textGrain setzt an dem Punkt an, an dem das Modell Wörter auswählt. Bei der Texterzeugung gibt es an vielen Stellen mehrere gleich passende Kandidatenwörter, und OpenAI entscheidet mithilfe eines Schlüssels, welches davon gewählt wird. Ein einzelner Satz wirkt völlig unauffällig; ist der Abschnitt aber lang genug, tauchen die vom Schlüssel bevorzugten Wörter so häufig auf, dass sie statistisch erkennbar werden – wer den Schlüssel besitzt, kann daran ablesen, ob ein Text von einem wasserzeichenversehenen Modell stammt.

Die von OpenAI genannten Erkennungswerte beziehen sich auf eine Falsch-Positiv-Rate von 1 Prozent:

  • Abschnitt mit 200 Token: Erkennungsrate rund 80 Prozent;
  • 400 Token: rund 95 Prozent;
  • 400-Token-Abschnitt mit 10 Prozent durch Synonyme ersetzten Wörtern: Rückgang auf 66 Prozent;
  • bei 25 Prozent ersetzten Wörtern: nur noch 17 Prozent.

Mit anderen Worten: Wer einen von ChatGPT erzeugten Text leicht umformuliert, macht das Wasserzeichen damit weitgehend unkenntlich. OpenAI verschweigt diesen Punkt in der Dokumentation nicht.

Bei der Qualität liege der Unterschied zwischen aktiviertem und deaktiviertem Wasserzeichen über acht Benchmarks hinweg im Rauschbereich, so das Unternehmen; bei einem Benchmark lagen die Werte bei 49,57 gegenüber 49,76.

Der Detektor bleibt der Öffentlichkeit verschlossen

Am stärksten eingeschränkt ist bei diesem System die Erkennungsseite. OpenAI öffnete am selben Tag einen Antragskanal, doch der Detektor steht nur "zugelassenen Forschern und Fachinstitutionen" zur Verfügung, die Freigabe erfolgt im Einzelfall. Normale Nutzer, Schulen oder Verlage können derzeit keinen eigenen Text damit prüfen.

OpenAI grenzt in der Dokumentation ausdrücklich ab:

"A watermark does not measure human contribution, does not establish ownership or responsibility, does not identify the user, and does not verify accuracy."

(Ein Wasserzeichen misst nicht den menschlichen Beitrag, begründet kein Eigentum und keine Verantwortung, identifiziert nicht den Nutzer und überprüft nicht die Richtigkeit des Inhalts.)

Das Unternehmen weist zudem darauf hin, dass ein nicht erkanntes Wasserzeichen nicht beweist, dass ein Text von einem Menschen stammt.

Der regulatorische Zeitplan

Artikel 50 des EU-KI-Gesetzes verpflichtet Anbieter generativer KI dazu, Ausgaben maschinell als KI-generiert erkennbar zu machen. Nach dem veröffentlichten Zeitplan gilt die Vorschrift seit dem 2. August, für bereits zuvor laufende Systeme gilt eine Übergangsfrist bis zum 2. Dezember. OpenAI hat sich für einen Rollout in der EU "in den kommenden Wochen" entschieden – zeitlich passt das in etwa in dieses Fenster.

Das erklärt auch, warum das Wasserzeichen nur in der EU standardmäßig aktiviert ist. In anderen Regionen bleiben die Ausgaben von ChatGPT und Codex vorerst ohne Wasserzeichen; API-Nutzer können es dort freiwillig selbst aktivieren.

Mehrere Akteure auf demselben Weg

Text-Wasserzeichen sind ein Feld, in das im vergangenen Jahr bereits mehrere Unternehmen eingestiegen sind.

Google DeepMind war mit SynthID der erste Anbieter von Text-Wasserzeichen, nach demselben Prinzip einer Verzerrung der Wortauswahl beim Sampling, und hat den Textteil später als Open Source veröffentlicht; Ende September übertrug DeepMind dieselbe Idee auf von KI entworfene Proteinsequenzen. Ausländischen Berichten zufolge hält OpenAI die Leistung von textGrain selbst für gleichwertig oder leicht besser als SynthID – eine Einschätzung, die bislang nicht unabhängig nachgeprüft wurde.

Anthropic kündigte im August ein Wasserzeichen für die Textausgabe von Claude an, mit einem ähnlichen Ansatz und demselben alten Problem, dass Umformulieren die Wirkung aufhebt. Das Inferenz-Framework vLLM machte im September ein auf Gumbel-Sampling basierendes Text-Wasserzeichen zur integrierten Option; Tests zeigten, dass bei kreativem Schreiben schon rund 100 Token vollständig erkannt wurden, bei Programmieraufgaben dagegen erst bei 400 Token nur 43 Prozent.

Stellt man die Zahlen der einzelnen Anbieter nebeneinander, zeigt sich ein klares Muster: Je länger und "freier" ein Text verfasst ist, desto besser lässt sich das Wasserzeichen erkennen; bei Code, Formeln oder faktenbasierten Antworten mit hoher Eindeutigkeit bleibt dagegen wenig Spielraum für eine Verzerrung der Wortwahl, das Signal ist von Natur aus schwächer. Die von textGrain veröffentlichten Werte gelten für allgemeinen Text; wie es sich bei Code verhält, hat OpenAI nicht gesondert angegeben.

Für Nutzer in China hat die Änderung vorerst wenig Auswirkung: Das Wasserzeichen ist standardmäßig nur in der EU aktiv, und ChatGPT ist in China ohnehin nicht direkt zugänglich. Chinas eigene "Maßnahmen zur Kennzeichnung von KI-generierten synthetischen Inhalten" gelten seit September vergangenen Jahres und verlangen eine Kombination aus expliziter Kennzeichnung und impliziter Metadaten-Kennzeichnung – ein anderer Ansatz.

Quellen: OpenAIs EU-Transparenzerklärung zu Text, AI Weekly, CocoLoop, CellCog-Technikanalyse; Erkennungsraten basieren auf einer Falsch-Positiv-Rate von 1 Prozent, der Geltungszeitpunkt richtet sich nach dem veröffentlichten EU-Zeitplan.