OpenAI 10 月 5 日公布了一套名為 textGrain 的文字浮水印方案,用來應對《歐盟人工智慧法案》第 50 條的透明度要求。接下來幾週內,歐盟地區符合資格的 ChatGPT 與 Codex 使用者,模型寫出的文字會自動帶上一層肉眼看不出、機器可以辨識的統計訊號。
全球的 API 客戶從當天起,也能針對部分模型手動開啟這項功能,預設是關閉的。公告沒有列出哪些模型支援。
浮水印藏在選詞裡
textGrain 的做法,是在模型挑選詞彙的環節動手。生成文字時,很多地方都有幾個同樣合適的候選詞,OpenAI 用一組金鑰決定最後選哪一個。單看一句話完全看不出異狀,但段落寫得夠長,符合金鑰偏好的詞就會多到在統計上可以辨認,握有金鑰的一方便能據此判斷這段文字是不是出自帶浮水印的模型。
OpenAI 給出的偵測數據,都是以 1% 誤判率為前提:
- 200 個 token 的段落,偵測率約 80%
- 400 個 token,偵測率約 95%
- 400 token 的段落裡換掉 10% 的詞為同義詞,偵測率降到 66%
- 換掉 25%,只剩 17%
也就是說,讀者拿到一段 ChatGPT 生成的文字,只要稍微改寫,浮水印基本上就認不出來了。OpenAI 在說明裡並沒有避開這一點。
品質方面,官方表示在八項基準測試上,開啟與關閉浮水印的成績差異落在誤差範圍內,其中一項的分數是 49.57 比 49.76。
偵測器不對外開放
這套方案裡限制最嚴的是偵測端。OpenAI 當天開放了申請通道,但偵測器只提供給「經核准的研究人員與專業機構」,逐案審核。一般使用者、學校、出版社目前都沒辦法自己拿一段文字去查。
OpenAI 在說明裡特別畫了界線:
"A watermark does not measure human contribution, does not establish ownership or responsibility, does not identify the user, and does not verify accuracy."
(浮水印不衡量人的貢獻,不確定所有權或責任歸屬,不識別使用者身分,也不核實內容是否準確。)
官方同時提醒,沒偵測到浮水印,並不能證明一段文字出自人手。
法規時間表
《歐盟人工智慧法案》第 50 條要求生成式 AI 的提供者,讓輸出內容可以被機器識別為 AI 生成。依照公開的時間表,這項條款從 8 月 2 日起適用,對已經上線的系統,則給到 12 月 2 日的合規寬限期。OpenAI 選擇在「接下來幾週」於歐盟全面推出,大致卡在這個時間窗裡。
這也說明了為什麼預設只在歐盟開啟。在其他地區,ChatGPT 和 Codex 的輸出目前暫不加浮水印,API 使用者如果願意,可以自己開啟。
同一條路上的幾家業者
文字浮水印這條路,過去一年已經擠進來好幾家業者。
Google DeepMind 的 SynthID 最早做文字浮水印,原理同樣是在取樣時偏向特定選詞,後來把文字部分開源,9 月底又把同樣的概念用在 AI 設計的蛋白質序列上。外界報導指出,OpenAI 自己認為 textGrain 的效果跟 SynthID 相當,甚至略好一些,不過這個說法目前還沒有第三方驗證。
Anthropic 8 月宣布為 Claude 的文字輸出加上浮水印,路線相近,同樣面臨「只要改寫就失效」的老問題。推理框架 vLLM 9 月把一種基於 Gumbel 取樣的文字浮水印做成內建選項,測試顯示創意寫作在約 100 個 token 就能全部辨認出來,程式碼任務寫到 400 個 token 卻只能辨認出 43%。
把幾家的數字放在一起看,共同的規律很清楚:文字越長、越「自由發揮」,浮水印就越好辨認;程式碼、公式、事實問答這類答案高度確定的內容,可以偏向選詞的空間本來就小,訊號天生就偏弱。textGrain 公布的是一般文字的成績,程式碼場景下表現如何,OpenAI 並沒有單獨給出數字。
對中國大陸的使用者來說,這次調整暫時影響不大:浮水印預設只在歐盟開啟,中國大陸本來就無法直接使用 ChatGPT。中國大陸的《人工智慧生成合成內容標識辦法》去年 9 月起施行,要求的是顯式標識加上隱式的元資料標識,走的是另一套思路。
參考來源:OpenAI 歐盟文字溯源說明、AI Weekly、CocoLoop、CellCog 技術解讀;偵測率按 1% 誤判率口徑計算,法案適用節點以歐盟公開時間表為準。