Google DeepMind 9 月 30 日發布 SynthID Bio,把浮水印直接寫進 AI 設計的蛋白質胺基酸序列裡。方法論文同步刊登在《自然》上,程式碼、體外實驗數據與模型權重都已開放給研究社群。
這套工具要回答的問題相當具體:一段蛋白質序列擺在眼前,能否驗證它出自某個可信的 AI 設計流程。DeepMind 把它定位成來源驗證手段,它無法判斷一個蛋白質是否危險。
浮水印怎麼寫進去
SynthID Bio 接在蛋白質設計工具 ProteinMPNN 上運作。ProteinMPNN 的運作方式是沿著蛋白質骨架一個位置一個位置地放入胺基酸,每一步都有多個化學性質相近的候選,比方說白胺酸、異白胺酸與纈胺酸在很多位置上可以互換。
SynthID Bio 在這一步介入:它根據一把浮水印金鑰與前面已選定的胺基酸,給出一個建議。只有在不影響蛋白質功能的前提下,設計流程才會採納這個建議。單看任何一個位置都看不出異狀,整條序列讀下來,符合金鑰偏好的胺基酸會比隨機情況多出一截。
檢測同樣靠統計。持有金鑰的一方掃描整條序列,計算有多少位置落在金鑰建議上,再跟門檻值比較。Ars Technica 的報導提醒,門檻值怎麼設定會直接改變誤判與漏判的比例,結果終究是一個機率性判斷。
實驗結果
團隊用帶浮水印的流程設計了針對三個靶點的結合蛋白:血管內皮生長因子 VEGF-A、新冠病毒棘蛋白的受體結合域、免疫檢查點蛋白 PD-L1。體外測試顯示,帶浮水印的設計在命中率與結合親和力上與無浮水印版本持平,序列多樣性也沒有下降。DeepMind 稱這是首批帶浮水印、且具備生物功能的蛋白質結合物。
他們還把同樣的思路用在 AlphaFold 3 的結構預測輸出上,檢測效果接近完美,對數值噪訊與小幅座標變動也扛得住。
DNA 合成公司 Twist Bioscience 負責政策與生物安全的副總裁 James Diggans 給出了這樣的評價:
"AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly."(AI 正在擴大科學家能設計的範圍,DNA 合成公司在幫助這類創新負責任地擴張上扮演重要角色。)
和文字浮水印放在一起看
SynthID 最早用在圖片上,後來擴展到文字、音訊與影片,文字浮水印在 2024 年開源。本站之前寫過 OpenAI 把 Google 浮水印裝進 ChatGPT,也寫過 Anthropic 替 Claude 輸出埋入隱形浮水印。這些方案共同的弱點是改寫:把一段文字換個說法,統計訊號就會被稀釋。
蛋白質這邊也有對應的「改寫」。報導列了幾種:很短的蛋白質容納不下足夠多的浮水印位點;在帶浮水印的序列後面接上一段天然序列(比方融合一個螢光蛋白),訊號會被沖淡;不少蛋白質設計工具並非基於 ProteinMPNN,也不是逐個放置胺基酸的路線,浮水印就接不進去。DeepMind 自己也承認,面對蓄意篡改的穩健性仍是難題。
還有一層是金鑰管理。整套體系的可信度取決於誰持有金鑰、怎麼分發、一旦外洩該怎麼辦,這部分目前還沒有成形的產業規範。
放在生物安全鏈的哪一環
現有的生物安全防線主要壓在 DNA 合成環節:合成公司拿訂單序列去比對已知的危險序列資料庫。AI 設計出來的新蛋白質可能跟任何已知序列都不像,比對就會漏掉。浮水印提供的是另一條線索,告訴合成公司這條序列來自一個登記過的設計流程。
它補的是來源這一塊,對危害判斷幫不上忙。一個沒有浮水印的序列,可能只是用了別的工具;一個帶浮水印的序列,也不代表它無害。DeepMind 在公告裡寫明,沒有哪一項生物安全措施能單獨解決問題。目前 DeepMind 透過 synthidbio@google.com 接洽合作夥伴,有多少合成公司、設計工具會接入,還要看後續進展。
參考來源:Google DeepMind 官方部落格、《自然》方法論文、CocoLoop、Ars Technica;靶點、命中率與親和力比較以論文與官方部落格口徑為準,侷限部分參考 Ars Technica 對方法的解讀。