vLLM: Eingebautes Wasserzeichen kostet kaum Durchsatz

Das Open-Source-Inferenz-Framework vLLM hat am 24. September in seinem offiziellen Blog angekündigt, ein auf der Gumbel-max-Methode basierendes Text-Wasserzeichen ins Framework aufgenommen zu haben, das serverseitig mit nur einem Startparameter aktiviert werden kann. Der Beitrag trägt drei Autorennamen, einer von Mistral, zwei von Red Hat.

Die Aktivierung ist denkbar einfach: An den Befehl vllm serve wird --watermark-config angehängt, dazu der Algorithmus gumbel sowie ein Schlüssel. Danach trägt jeder von diesem Server erzeugte Text ein für das bloße Auge unsichtbares statistisches Signal.

Wie das Wasserzeichen versteckt wird

Bei jedem erzeugten Wort weist ein großes Modell zunächst allen Kandidatenwörtern eine Wahrscheinlichkeit zu und zieht dann eines davon. Genau an diesem Zieh-Schritt setzt das Gumbel-max-Wasserzeichen an.

Konkret wird aus dem Schlüssel, dem Kontext der letzten Wörter und der Kandidatennummer eine Zahlenfolge berechnet, die völlig zufällig aussieht, sich aber mit Kenntnis des Schlüssels reproduzieren lässt. Diese wird in Gumbel-Rauschen umgewandelt und auf die Modellbewertung addiert; das Maximum wird als Ausgabe gewählt. Mathematisch ist die Verteilung der so gezogenen Ergebnisse identisch mit gewöhnlichem Zufallssampling, weshalb die Autoren es „verzerrungsfrei“ nennen: Das Modell bevorzugt dadurch keine bestimmten Wörter, keinen Schreibstil und keine Lösungsart.

Die Prüfseite benötigt keine Modellgewichte, nur den Schlüssel und den Tokenizer. Der Text wird in Token zurückverwandelt, mit demselben Schlüssel wird dieselbe Pseudozufallsfolge neu berechnet, jedes Token einzeln bewertet und die Werte summiert; der Vergleich mit der erwarteten Verteilung ohne Wasserzeichen ergibt einen p-Wert. Nach der von den Autoren angegebenen Kalibrierung werden etwa 1 Prozent der Texte ohne Wasserzeichen fälschlich als markiert erkannt.

Zwei Zahlenreihen zu Kosten und Wirkung

Bei der Performance testeten die Autoren auf einer einzelnen H100 mit Qwen3.5-27B eine Ausgabe von 512 Token: Bei Batchgröße 1 änderte sich der Durchsatz um -0,23 Prozent, bei Batchgröße 32 um +2,03 Prozent, die Gruppenmittelwerte lagen zwischen -1,1 und +2,0 Prozent. Die Autoren schließen daraus, dass es keine konsistente Durchsatzveränderung gibt. Um Grafikspeicher zu sparen, hat vLLM Pseudozufallsgenerierung, Gumbel-Transformation und Maximumsbestimmung in einem einzigen GPU-Kernel zusammengefasst.

Bei der Modellqualität, ebenfalls mit Qwen3.5-27B, lautet der Vergleich mit und ohne Wasserzeichen: GSM8K 93,0 Prozent gegenüber 94,2 Prozent, MBPP 79,2 Prozent gegenüber 77,2 Prozent, IFEval 90,7 Prozent gegenüber 91,9 Prozent. Die Autoren sehen die Unterschiede im Rahmen der Fehlertoleranz.

Deutlich größer fallen die Unterschiede bei der Erkennungsrate aus. Bei einer Falsch-positiv-Rate von 1 Prozent lässt sich kreatives Schreiben bereits nach rund 100 Token vollständig erkennen; bei MBPP-Code-Aufgaben liegt die Erkennungsrate nach 400 Token nur bei 43 Prozent. Der Grund liegt im Prinzip selbst: Bei Code-Ausgaben ist sich das Modell beim nächsten Wort meist sehr sicher, sodass für das Wasserzeichen ohnehin wenig Zufälligkeit zur Verfügung steht. Auch kurze Texte liefern ein schwaches Signal. Wird ein Text nachträglich von Menschen bearbeitet, werden die Bewertungen in der Nähe der Änderung durcheinandergebracht, außerhalb dieses Abschnitts erholt sich das Signal aber wieder.

Bei der Umsetzung gibt es zwei weitere Stolpersteine. Der eine betrifft spekulatives Decodieren: Die Autoren verwenden zwei getrennte Schlüssel für Entwurfs-Token und das Residual-Sampling des Zielmodells, um die Annahmerate zu erhalten – der Preis dafür ist, dass sich das Erkennungssignal auf zwei Schlüssel aufteilt. Der andere betrifft wiederholte Kontexte, die dieselbe Zufallsfolge erzeugen und das Modell in eine Endlosschleife treiben können; die Lösung besteht darin, das Wasserzeichen bei wiederholtem Kontext zu überspringen, was den Durchsatz um höchstens 0,19 Prozent beeinflusst.

Was das für Betreiber in China bedeutet

Chinas „Maßnahmen zur Kennzeichnung von KI-generierten und synthetischen Inhalten“ sind seit September vergangenen Jahres in Kraft und verlangen für generierte Inhalte eine sichtbare oder unsichtbare Kennzeichnung. Bei Text stützt sich die unsichtbare Kennzeichnung bislang meist auf Metadaten; ein statistisches Wasserzeichen kann dagegen direkt in den Text selbst eingebettet werden. Mit diesem Update hat vLLM daraus praktisch einen Schalter gemacht, den zahlreiche Teams in China, die eigene Inferenzdienste auf Basis von vLLM betreiben, direkt ausprobieren können.

Die Grenzen dieses Ansatzes sind aber ebenso klar: Die Erkennung hängt vom Schlüssel ab, den jeweils der Betreiber selbst hält – eine unabhängige Prüfung durch Dritte ist nicht möglich; bei Code und kurzen Antworten fällt die Erkennungsrate niedrig aus; bei umfangreicher menschlicher Überarbeitung schwächt sich das Signal ab. Ob damit die konkreten regulatorischen Anforderungen an eine „unsichtbare Kennzeichnung“ erfüllt werden, hängt davon ab, ob es künftig passende Prüfstandards gibt – bislang gibt es dazu keine offizielle Aussage.

Quellen: offizieller vLLM-Blog, CocoLoop, Maßnahmen zur Kennzeichnung von KI-generierten und synthetischen Inhalten; Durchsatz-, Benchmark- und Erkennungswerte stammen aus den Tests der Autoren mit Qwen3.5-27B auf einer einzelnen H100.