Basis Data AlphaFold Tambahkan Kompleks Protein dari 2.800+ Virus

European Bioinformatics Institute (EMBL-EBI) di bawah European Molecular Biology Laboratory mengumumkan pada 24 September bahwa basis data AlphaFold telah menambahkan sejumlah prediksi struktur tiga dimensi baru untuk kompleks protein virus, mencakup lebih dari 2.800 spesies virus. Data ini dapat dicari dan diunduh gratis melalui Pandemic Preparedness Portal yang baru diluncurkan di basis data tersebut.

Rilis ini merupakan hasil kolaborasi banyak pihak. Selain EMBL-EBI, Google DeepMind, dan Nvidia, turut terlibat Coalition for Epidemic Preparedness Innovations (CEPI), Seoul National University, Sungkyunkwan University, Swiss Institute of Bioinformatics, serta University of Glasgow. Prediksi struktur dibuat menggunakan AlphaFold2 milik DeepMind, dipercepat dengan runtime inferensi BioNeMo dari Nvidia, dan seluruh alur prediksi strukturnya dibuka sebagai open source di GitHub.

Apa Saja yang Ada dalam Data Ini

Dalam memilih virus mana yang dimasukkan, tim kolaborasi memprioritaskan famili virus yang diketahui menginfeksi manusia. Pengumuman EMBL secara khusus menyebut dua kategori: rhinovirus, penyebab umum flu biasa, dan ancaman baru seperti mpox (cacar monyet).

Berbeda dari prediksi protein tunggal sebelumnya, data kali ini berfokus pada kompleks — yaitu bagaimana beberapa protein berikatan untuk berfungsi bersama. Banyak tahap saat virus menginvasi sel dan bereplikasi di dalamnya bergantung pada ikatan antarprotein. Menurut blog Nvidia, sekitar 30% dari interaksi protein yang baru ditambahkan sepenuhnya baru, tanpa catatan eksperimen atau literatur sebelumnya.

"This dataset is an engine for hypothesis generation."

Dari Maret ke September

Jika dirangkai dalam garis waktu, rilis ini adalah langkah kedua tim yang sama tahun ini. Pada 16 Maret lalu, EMBL-EBI, DeepMind, Nvidia, dan Seoul National University pertama kali menambahkan kompleks ke basis data AlphaFold: total sekitar 30 juta struktur diprediksi, dengan 1,7 juta homodimer berkeyakinan tinggi langsung dimasukkan ke basis data, dan sekitar 18 juta lagi yang keyakinannya lebih rendah dirilis untuk diunduh, mencakup 20 spesies prioritas termasuk manusia ditambah daftar patogen prioritas WHO.

Enam bulan kemudian, daftar kolaborator kini bertambah organisasi kesiapsiagaan pandemi seperti CEPI serta beberapa institusi virologi dan bioinformatika, sementara cakupannya menyempit dari "spesies prioritas" menjadi "virus", dan tujuannya dinyatakan lebih eksplisit: pengembangan vaksin dan obat. Waktu perilisannya pun diperhitungkan — pengumuman EMBL menyebut bahwa Sidang Umum PBB akan menggelar pertemuan tingkat tinggi mengenai pencegahan, kesiapsiagaan, dan respons pandemi pada 25 September, dan data ini dirilis satu hari sebelumnya.

Blog Nvidia juga mengutip estimasi dari Center for Global Development: hingga tahun 2050, dunia menghadapi kemungkinan sekitar 50% untuk kembali mengalami pandemi setara COVID-19.

Batasan yang Perlu Diketahui Sebelum Digunakan

EMBL menegaskan batasan data ini dengan jelas dalam pengumumannya. Prediksi struktur tidak bisa digunakan untuk menyimpulkan dampak mutasi genetik, tidak bisa menentukan bagaimana inang dan patogen berinteraksi, dan terlebih lagi tidak bisa dipakai untuk menilai apakah virulensi atau daya tular suatu virus berubah — semua kesimpulan tetap harus diverifikasi di laboratorium. Joe Grove, profesor virologi molekuler di University of Glasgow, menyampaikannya secara blak-blakan:

"A protein complex structure alone doesn't tell us what happens when a virus mutates."

Apakah keterbukaan data struktur virus ini menimbulkan risiko keamanan hayati, tidak dibahas secara langsung dalam pengumuman-pengumuman tersebut, begitu pula soal apakah ada patogen berisiko tinggi yang sengaja dikecualikan dari seleksi. Ketentuan lisensi data juga tidak dijelaskan dalam pengumuman EMBL kali ini.

Bagi tim biologi struktural dan pengembangan vaksin di China, data ini bisa langsung diunduh dan digunakan dengan ambang masuk yang rendah; bagian sulitnya ada di tahap berikutnya, yaitu validasi eksperimen basah (wet-lab), yang belum banyak bisa dibantu oleh AI.

Sumber: pengumuman resmi EMBL-EBI, blog resmi Nvidia, CocoLoop, Nature News; jumlah spesies virus, angka 30% interaksi baru, dan total 260 juta prediksi mengikuti angka yang diberikan EMBL dan Nvidia.