オープンソースの推論フレームワークvLLMは9月24日、公式ブログでGumbel-max方式に基づくテキスト透かし機能をフレームワークに組み込んだと発表した。サーバー起動時のオプション一つで有効化できる。投稿の署名は3人で、うち1人はMistral、2人はRed Hat所属。
有効化の方法は単純で、vllm serveコマンドに--watermark-configを追加し、アルゴリズムにgumbelを指定、鍵を1つ与えるだけでよい。以後このサーバーが生成するすべてのテキストには、肉眼では見えない統計的な信号が付与される。
透かしはどう埋め込まれるのか
大規模モデルは単語を1つ生成するたびに、まず候補となる全単語に確率を割り振り、そこから1つを抽出する。Gumbel-max透かしが手を加えるのは、この「抽出」の部分だ。
具体的には、鍵・直近の単語列の文脈・候補単語の番号を使って、一見完全にランダムだが鍵さえ分かれば再現できる数列を計算し、それをGumbelノイズに変換してモデルのスコアに加算、最大値を取った候補を出力とする。数学的には、この方法で抽出される結果の分布は通常のランダムサンプリングと完全に一致する。そのため著者らはこれを「歪みなし(distortion-free)」と呼ぶ——モデルが特定の単語や文体、解法に偏ることはない。
検出側はモデルの重みを必要とせず、鍵とトークナイザーさえあればよい。テキストをトークン列に戻し、同じ鍵で先の擬似乱数列を再計算、各トークンにスコアを付けて合計し、透かしがない場合に想定される分布と比較してp値を求める。著者らが示す較正基準では、透かしのないテキストが誤検出される割合はおよそ1%とされる。
コストと効果、2組の数字
性能面では、著者らはH100 1枚でQwen3.5-27Bを用い、512トークン出力のシナリオを検証した。バッチサイズ1ではスループットが-0.23%、バッチサイズ32では+2.03%変化し、各グループの平均は-1.1%から+2.0%の範囲に収まった。著者らは「スループットへの一貫した影響は見られない」と結論づけている。メモリを節約するため、vLLMは擬似乱数生成・Gumbel変換・最大値抽出を1つのGPUカーネルにまとめている。
モデル品質については、同じくQwen3.5-27Bで透かしあり・なしを比較したところ、GSM8Kが93.0%対94.2%、MBPPが79.2%対77.2%、IFEvalが90.7%対91.9%となった。著者らはいずれも誤差の範囲内としている。
検出率の差はかなり大きい。誤検出率1%の基準で見ると、創作文では約100トークンで全件検出できる一方、MBPPのコード問題では400トークンまで生成しても検出率は43%にとどまる。原理を踏まえれば理由は明快で、コードのような出力はモデルが次の単語にほぼ確信を持っているケースが多く、透かしに使えるランダム性がそもそも少ない。短いテキストも同様に信号が弱い。テキストが人の手で改変されると、改変箇所付近のスコアは乱れるが、その文脈から離れれば信号は回復する。
実装上の落とし穴も2つある。1つは投機的デコーディングで、著者らはドラフトトークン用とターゲットモデルの残差サンプリング用に別々の鍵を使い分けることで採択率を維持しているが、その代償として検出信号が2つの鍵に分散してしまう。もう1つは、同じ文脈が繰り返されると同じ乱数列が生成されてしまい、モデルが無限に同じ内容を繰り返す状態に陥りかねない点だ。対策として、繰り返しの文脈を検知した場合は透かし処理をスキップしており、これによるスループットへの影響は最大でも0.19%にとどまる。
国内(中国)の運用者にとっての意味
中国の「人工知能生成合成内容標識弁法」は昨年9月に施行され、生成コンテンツに明示的または非明示的な標識を付けるよう求めている。テキストに関しては、非明示的な標識は現状メタデータに頼る例が多いが、統計的な透かしは文章そのものに埋め込むことができる。今回vLLMがこれをスイッチ一つで扱えるようにしたことで、中国国内でvLLMを使って推論サービスを自前運用する多数のチームがそのまま試せるようになった。
ただし、この方式の限界もはっきりしている。検出は鍵に依存し、鍵を持つのは運用者自身だけなので、第三者が独立に検証することはできない。コードや短い応答では検出率が低く、人手による大幅な書き換えを受けると信号は弱まる。規制が求める「非明示的標識」の具体的な要件を満たせるかどうかは、今後対応する検出基準が整うかどうかに左右されるが、現時点で公開されている基準はない。
参考資料: vLLM公式ブログ、CocoLoop、「人工知能生成合成内容標識弁法」;スループット・ベンチマークスコア・検出率はいずれも著者らがQwen3.5-27BとH100 1枚で行ったテストに基づく。