Google DeepMindは9月30日、AIが設計したタンパク質のアミノ酸配列に直接透かしを書き込む「SynthID Bio」を発表した。手法をまとめた論文はNatureに同時掲載され、コードとin vitro実験データ、モデルの重みは研究コミュニティに公開されている。
このツールが答えようとする問いは具体的だ。目の前にあるタンパク質配列が、信頼できるAI設計パイプラインから生まれたものかどうかを検証できるか、という点である。DeepMindはこれを出自の検証手段と位置づけており、タンパク質が危険かどうかを判断するものではないとしている。
透かしの書き込み方
SynthID Bioはタンパク質設計ツール「ProteinMPNN」の上に乗る形で動く。ProteinMPNNはタンパク質の骨格に沿って1つずつアミノ酸を配置していく仕組みで、多くの位置では化学的性質が近い複数の候補が存在する。例えばロイシン、イソロイシン、バリンは多くの位置で互換が可能だ。
SynthID Bioはまさにこの段階に介入する。透かし用の鍵と、それまでに選ばれたアミノ酸をもとに候補を提案し、タンパク質の機能に影響しない場合に限って設計パイプラインがその提案を採用する。1カ所だけを見ても違和感はないが、配列全体を通すと、鍵の好みに合致するアミノ酸が偶然よりも多く現れる。
検出も統計的な手法に基づく。鍵を持つ側が配列全体を走査し、鍵の提案と一致する位置の数を数え、しきい値と比較する。Ars Technicaの報道は、しきい値の設定次第で誤検出と見逃しの比率が直接変わると指摘しており、結果はあくまで確率的な判断になる。
実験結果
研究チームは透かし入りパイプラインを使い、血管内皮増長因子VEGF-A、新型コロナウイルスのスパイクタンパク質受容体結合領域、免疫チェックポイントタンパク質PD-L1という3つの標的に対する結合タンパク質を設計した。in vitro試験では、透かし入りの設計が的中率と結合親和性で透かしなし版と同水準であり、配列の多様性も低下しなかった。DeepMindは、これが機能を持つ透かし入りタンパク質結合体としては初の例だとしている。
同じ発想はAlphaFold 3の構造予測出力にも適用され、検出精度はほぼ完璧で、数値ノイズや座標のわずかな変化にも耐えたという。
DNA合成企業Twist Bioscienceで政策・生物安全保障を担当する副社長James Diggans氏はこう評価している。
"AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly."(AIは科学者が設計できる範囲を広げており、DNA合成企業にはその革新を責任ある形で拡大させる重要な役割がある)
テキスト透かしと並べてみると
SynthIDはもともと画像向けに始まり、その後テキスト・音声・動画に拡張された。テキスト版の透かしは2024年にオープンソース化されている。本サイトでは以前、OpenAIがChatGPTにGoogleの透かしを組み込んだ件や、AnthropicがClaudeの出力に見えない透かしを埋め込んだ件を取り上げた。これらの方式に共通する弱点は「言い換え」だ。文章を別の言葉で書き直すと、統計的な信号は薄まってしまう。
タンパク質の側にも、言い換えに相当する弱点がある。報道がいくつか挙げている。非常に短いタンパク質は透かしを入れる位置が十分に確保できない。透かし入り配列の後ろに天然配列をつなぐ場合(例えば蛍光タンパク質を融合させる場合)、信号が薄まる。また多くのタンパク質設計ツールはProteinMPNNをベースにしておらず、アミノ酸を1つずつ配置する方式も取っていないため、透かしを組み込めない。DeepMind自身も、意図的な改変に対する耐性は依然として難題だと認めている。
さらに鍵管理の問題もある。この仕組み全体の信頼性は、誰が鍵を持ち、どう配布し、漏えいした場合にどうするかに左右されるが、この部分にはまだ業界としての定まった取り組みがない。
生物安全保障の鎖のどこに位置するか
現在の生物安全保障の防衛線は主にDNA合成の段階に置かれている。合成企業は注文された配列を既知の危険な配列データベースと照合する。AIが設計した新規タンパク質は既知のどの配列とも似ていない可能性があり、その場合は照合で見逃されてしまう。透かしはもう一つの手がかりを提供し、その配列が登録済みの設計パイプライン由来であることを合成企業に伝える。
これが補うのは出自の確認であり、危険性の判断には役立たない。透かしのない配列は単に別のツールを使っただけかもしれないし、透かしのある配列が無害だとは限らない。DeepMindは発表の中で、単一の生物安全保障対策だけで問題を解決できるものはないと明記している。現時点でDeepMindはsynthidbio@google.comを通じて協力相手と連絡を取っており、どれだけの合成企業や設計ツールが採用するかは今後の展開次第だ。
参考資料:Google DeepMind公式ブログ、Nature掲載の方法論論文、CocoLoop、Ars Technica。標的タンパク質や的中率、親和性の比較は論文と公式ブログの記述に基づき、限界に関する記述はArs Technicaによる解説を参考にした。