DeepMind Tambahkan Watermark ke Protein Hasil Desain AI

Google DeepMind merilis SynthID Bio pada 30 September, sebuah sistem yang menuliskan watermark langsung ke dalam urutan asam amino protein yang didesain AI. Makalah metode pendampingnya terbit bersamaan di Nature, dan DeepMind membuka kode, data eksperimen in vitro, serta bobot model untuk komunitas riset.

Alat ini menjawab pertanyaan yang spesifik: dari sebuah urutan protein, bisakah dipastikan bahwa urutan itu berasal dari jalur desain AI yang terpercaya? DeepMind memposisikannya murni sebagai pemeriksaan asal-usul — alat ini tidak menilai dan tidak bisa menilai apakah suatu protein berbahaya.

Bagaimana watermark ditanamkan

SynthID Bio berjalan di atas ProteinMPNN, alat desain protein yang banyak dipakai. ProteinMPNN bekerja dengan menempatkan asam amino satu posisi demi satu posisi di sepanjang kerangka protein, dan di banyak posisi terdapat beberapa kandidat dengan sifat kimia yang mirip — leusin, isoleusin, dan valin, misalnya, sering bisa saling menggantikan tanpa merusak struktur.

SynthID Bio turun tangan tepat di langkah ini. Berdasarkan kunci watermark dan asam amino yang sudah dipilih sebelumnya dalam urutan, sistem ini mengajukan sebuah kandidat. Jalur desain hanya menerima usulan itu bila tidak mengganggu fungsi protein. Satu posisi saja tidak terlihat aneh, tetapi di sepanjang urutan penuh, asam amino yang sesuai preferensi kunci muncul lebih sering daripada yang diharapkan secara kebetulan.

Deteksinya juga bersifat statistik. Siapa pun yang memegang kunci memindai seluruh urutan, menghitung berapa posisi yang sesuai dengan saran kunci, lalu membandingkannya dengan ambang batas. Liputan Ars Technica mencatat bahwa penentuan ambang batas ini langsung memengaruhi rasio antara kesalahan positif dan kesalahan negatif — hasilnya adalah penilaian probabilistik, bukan jawaban pasti ya-tidak.

Hasil eksperimen

Tim menggunakan jalur berwatermark untuk mendesain protein pengikat bagi tiga target: faktor pertumbuhan endotel vaskular VEGF-A, domain pengikatan reseptor protein spike SARS-CoV-2, dan protein immune checkpoint PD-L1. Uji in vitro menunjukkan desain berwatermark menyamai versi tanpa watermark dalam tingkat keberhasilan dan afinitas pengikatan, tanpa penurunan keragaman urutan. DeepMind menyebut ini sebagai protein pengikat berwatermark pertama yang punya fungsi biologis.

Pendekatan yang sama juga diterapkan pada keluaran prediksi struktur AlphaFold 3, dengan deteksi yang hampir sempurna dan tahan terhadap noise numerik maupun perubahan koordinat kecil.

James Diggans, wakil presiden kebijakan dan biosekuriti di perusahaan sintesis DNA Twist Bioscience, memberikan penilaian berikut:

"AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly." (AI memperluas apa yang bisa didesain oleh para ilmuwan, dan perusahaan sintesis DNA punya peran penting membantu inovasi itu berkembang secara bertanggung jawab.)

Dibandingkan dengan watermark teks

SynthID awalnya dipakai untuk gambar, lalu diperluas ke teks, audio, dan video; watermark teksnya dibuka sebagai open source pada 2024. Situs ini sebelumnya pernah menulis tentang OpenAI yang memasukkan watermark Google ke ChatGPT, juga tentang Anthropic yang menanamkan watermark tak terlihat pada keluaran Claude. Semua skema ini punya kelemahan yang sama: parafrasa. Menulis ulang sebuah teks dengan kata-kata berbeda akan melunturkan sinyal statistiknya.

Protein juga punya "parafrasa" versinya sendiri. Liputan menyebutkan beberapa: protein yang sangat pendek tidak punya cukup posisi untuk menampung watermark yang andal; menyambungkan urutan alami setelah urutan berwatermark — misalnya menggabungkan protein fluoresens — akan melunturkan sinyal; dan banyak alat desain protein yang tidak dibangun di atas ProteinMPNN atau tidak menempatkan asam amino satu per satu, sehingga watermark tidak punya tempat untuk ditempelkan. DeepMind sendiri mengakui bahwa ketahanan terhadap manipulasi yang disengaja masih menjadi masalah terbuka.

Ada juga soal pengelolaan kunci. Keandalan seluruh sistem ini bergantung pada siapa yang memegang kunci, bagaimana kunci didistribusikan, dan apa yang terjadi jika bocor — dan belum ada aturan baku di industri untuk hal ini.

Di mana posisinya dalam rantai biosekuriti

Pertahanan biosekuriti saat ini sebagian besar bertumpu pada tahap sintesis DNA: perusahaan sintesis memeriksa urutan yang dipesan terhadap basis data urutan berbahaya yang sudah dikenal. Protein baru hasil desain AI mungkin tidak menyerupai apa pun dalam basis data itu, sehingga pemeriksaan bisa luput. Watermark menawarkan petunjuk lain — memberi tahu perusahaan sintesis bahwa urutan itu berasal dari jalur desain yang terdaftar.

Ini mengisi celah asal-usul, bukan celah penilaian bahaya. Urutan tanpa watermark mungkin saja hanya berasal dari alat lain; urutan berwatermark pun tidak otomatis berarti aman. Pengumuman DeepMind menegaskan tidak ada satu pun langkah biosekuriti yang bisa menyelesaikan masalah ini sendirian. Untuk saat ini DeepMind menghubungi mitra melalui synthidbio@google.com, dan masih harus dilihat berapa banyak perusahaan sintesis serta alat desain yang akan mengadopsinya.

Sumber: blog resmi Google DeepMind, makalah metode di Nature, CocoLoop, Ars Technica. Target protein, tingkat keberhasilan, dan perbandingan afinitas mengikuti makalah serta blog resmi; bagian keterbatasan mengacu pada analisis Ars Technica terhadap metode ini.