Claude Desain Protein, Berhasil di 14 dari 15 Target

Anthropic merilis laporan eksperimen pada 18 Agustus: Claude ditugaskan mendesain pengikat molekul kecil dari nol untuk sejumlah target protein, dan berhasil menghasilkan desain yang bisa dipakai untuk 14 dari 15 target. Sintesis dan pengujian dilakukan oleh Adaptyv Bio dan Twist Bioscience — bukan model itu sendiri yang menilai hasilnya.

Angka-angkanya lebih meyakinkan daripada kesimpulan itu sendiri. Dalam mode multi-target, tingkat keberhasilan Mythos Preview mencapai 26,7% dan Opus 4.8 sebesar 22,6%; setelah beralih ke fokus target tunggal, Mythos Preview naik menjadi 35,1%. Sebagai perbandingan, tingkat keberhasilan yang biasa dilaporkan secara publik di bidang ini berkisar 10-15%. Secara total, 1.320 desain menghasilkan 354 pengikat yang tervalidasi secara eksperimental, dengan enam target menghasilkan pengikat berafinitas tinggi — empat di antaranya menyamai atau melampaui hasil terbaik yang pernah dipublikasikan.

Beberapa Target yang Paling Sulit

RBX1 paling menunjukkan kesenjangan itu. Tingkat keberhasilan Claude pada target ini mencapai 40%, sementara rata-rata peserta kompetisi untuk target yang sama hanya 3,7% — dan desain akhirnya bahkan mengungguli entri pemenang kompetisi tahun itu.

Pada TNFα, pekerjaannya melintasi spesies: kumpulan desain yang sama mengikat protein manusia, monyet macaque, dan tikus sekaligus. Ini punya bobot besar dalam pengembangan obat — apakah uji hewan dan uji manusia bisa memakai molekul yang sama secara langsung menentukan berapa lama tahap pengembangan awal berlangsung.

Satu kelompok lagi sengaja memilih tingkat kesulitan tinggi: mendesain pengikat dengan kandungan beta-sheet tinggi. Struktur semacam ini selalu sulit bagi desain komputasional, karena pemasangan untai beta memberi sedikit ruang untuk kesalahan. Putaran ini menghasilkan 15 pengikat berfungsi dengan kandungan untai beta setidaknya 20%.

Anthropic juga mencatat kegagalannya: dua target, BBF-14 dan MBP, tidak berkinerja baik. Tidak ada yang percaya laporan yang hanya memuat keberhasilan — mencantumkan dua target ini justru meningkatkan kredibilitas data lainnya.

Rincian Biaya Komputasi

Alur kerja ini tidak murah. Satu putaran mode multi-target mengonsumsi hingga 12.500 jam-H100 NVIDIA dan memakan waktu 48 jam nyata; mode target tunggal memakai 2.500 jam-H100 per target selama 24 jam. Prompt awalnya sekitar 30.000 token.

Dengan tarif sewa H100 di cloud saat ini, sekitar 2-3 dolar AS per jam-GPU, 12.500 jam-GPU setara dengan 20.000-30.000 dolar AS per putaran — dibagi ke 15 target, itu sekitar 2.000 dolar AS per target. Angka ini nyaris tidak berarti dalam anggaran penemuan obat tahap awal: satu putaran sintesis protein plus uji afinitas di laboratorium basah saja sudah berbiaya setara, sementara jalur tradisional membutuhkan banyak putaran coba-coba untuk mendekati tingkat keberhasilan yang sama. Komputasi menjadi mata rantai termurah dalam proses ini — kesimpulan yang belum berlaku beberapa tahun lalu.

Satu Hal Lagi yang Dikerjakan Sambil Lalu

Rangkaian eksperimen yang sama juga mencakup uji kimia analitik terpisah menggunakan Claude Opus 5. Tugasnya adalah memproses keluaran instrumen laboratorium sungguhan: model menyelesaikan spektrum NMR dalam 23 menit dan data LC-MS dalam 19 menit. Berkas mentah LC-MS berformat proprietary, dan model mengurainya sendiri, memeriksa silang data dari 2.664 kali pemindaian (scan).

Soal akurasi: jumlah atom hidrogen menyimpang dari hasil manual tidak lebih dari 0,08 ¹H, dan pengukuran kemurnian menunjukkan 96,4% dibanding nilai acuan laboratorium 96,33%. Setelah selesai, model secara mandiri mengusulkan eksperimen validasi lanjutan yang perlu dilakukan — dan rencananya sesuai dengan yang sudah dijadwalkan laboratorium.

Bagian ini mungkin tertutup oleh angka-angka protein di atas, padahal tidak seharusnya begitu. Bagian yang paling menyita tenaga kerja dalam penemuan obat bukanlah tahap desain, melainkan menafsirkan dan mengarsipkan puluhan hingga ratusan spektrum setiap hari — pekerjaan rutin seorang peneliti pascadoktoral. Model yang bisa membaca berkas instrumen berformat proprietary dan memutuskan sendiri langkah selanjutnya sedang menggarap tepat bagian itu.

Batasan yang Sengaja Dipasang

Anthropic menyatakan dengan jelas dalam laporannya bahwa desain protein dan kemampuan riset biologi dwiguna lainnya tidak tersedia bagi pengguna umum di Claude Fable 5. Itu adalah gerbang yang sengaja dipasang perusahaan: kemampuan yang sama yang mendesain pengikat juga bisa dipakai untuk mendesain hal lain, dan Anthropic memilih menjaganya di jalur yang terkendali alih-alih langsung meluncurkannya ke produk konsumen.

Dataset dan prompt yang dipakai dalam eksperimen sudah diunggah ke Hugging Face, dengan laporan teknis terpisah yang dipublikasikan untuk pekerjaan desain protein dan analisis kimia. Merilis prompt bersama semua itu mengindikasikan Anthropic melihat hambatan sesungguhnya dari metode ini ada pada komputasi dan pekerjaan laboratorium basah, bukan pada rekayasa prompt itu sendiri.

Sumber: halaman riset resmi Anthropic, catatan eksperimen Adaptyv Bio dan Twist Bioscience, CocoLoop, dataset publik Hugging Face; definisi tingkat keberhasilan, angka jam-H100, dan nilai acuan kemurnian 96,4% telah diperiksa silang.