Trail of Bits mempublikasikan tulisan pada 15 September yang menyebut kesimpulan dalam laporan benchmark tambalan AI milik 1Password tidak kuat. Angka utama yang diumumkan 1Password adalah tingkat "perbaikan bersih" 26%. Trail of Bits menghitung ulang penilaian pada dataset yang sama dan mendapati 2.634 dari 3.067 tambalan berhasil memblokir eksploit pasangannya — 86%.
Kedua angka itu terpaut 60 poin persentase, dan selisihnya berasal dari cara penilaian dilakukan.
Empat masalah yang disoroti Trail of Bits
Trail of Bits mendaftar empat masalah:
- Sampelnya terlalu sempit. Seluruh benchmark hanya memakai enam kerentanan kompleks, dengan tingkat perbaikan yang berayun dari 3% sampai 60% antar-kerentanan. Merata-ratakan enam hasil yang sangat berbeda menjadi satu skor "kemampuan menambal AI" membuat derau sampling mengalahkan sinyalnya.
- Sebagian prompt cacat sejak desainnya. 22% data berasal dari uji coba yang promptnya sengaja mengarahkan agent ke perbaikan yang salah. Uji coba semacam itu mengukur apakah model bisa disesatkan, bukan apakah ia bisa memperbaiki dengan benar.
- Perkakasnya dicabut. Pada 36% uji coba, model tidak diizinkan mengompilasi atau menguji kodenya sendiri. Pengembang manusia yang menambal kerentanan yang sama dalam batasan serupa juga tidak akan mendapat nilai jauh lebih baik.
- Konfigurasinya tidak konsisten. Model yang berbeda dijalankan dengan pengaturan reasoning yang berbeda, sehingga skornya tidak bisa dibandingkan langsung antar-model.
Tulisan ini ditulis atas nama empat penulis: Anish Naik, Dan Guido, Benjamin Samuels, dan Marcelo Morales. Sejauh ini 1Password belum memberi tanggapan publik atas analisis ulang tersebut.
Garis dasar manusia
Bagian yang lebih meyakinkan dari tulisan ini adalah kelompok pembandingnya. Trail of Bits mengutip data yang menunjukkan bahwa pengembang yang menambal kerentanan keamanan dalam kondisi ideal gagal pada percobaan pertama sekitar 12,5% dari waktu — kira-kira satu dari delapan kali meleset.
Garis dasar itulah yang membuat penilaian "AI tidak bisa menambal dengan bersih" punya makna nyata. Tingkat perbaikan bersih 26% terlihat seperti nilai gagal jika berdiri sendiri. Namun ditempatkan di samping garis dasar manusia 87,5%, skor AI 86% menceritakan hal lain: kira-kira setara, belum unggul.
Trail of Bits juga membagikan angka dari proyeknya sendiri, Patch the Planet: 186 pull request diajukan, 126 digabungkan ke upstream, tingkat penggabungan 67,7%; dari yang digabungkan, 72,2% tidak memerlukan revisi keamanan lebih lanjut. Ini tolok ukur yang berbeda dari uji coba benchmark — ia mengukur apakah maintainer sungguhan menerima sebuah tambalan, yang lebih dekat ke kenyataan produksi ketimbang sekadar memblokir eksploit.
Dua skill yang ikut dirilis
Tulisan ini juga mengumumkan dua skill agent: post-patch-validation, yang membuat agent menguji dan memverifikasi pekerjaannya sendiri sebelum mengajukan tambalan, dan review-walkthrough, yang memandu engineer menelusuri perubahan kode secara berurutan dan logis.
Perilisan kedua skill itu sendiri adalah tanggapan atas benchmark tersebut. Pada 36% uji coba yang dipermasalahkan, model dilarang mengompilasi atau menguji kode — dan skill pertama yang baru dirilis justru dibangun khusus untuk validasi sebelum pengajuan. Artinya, kualitas tambalan sangat bergantung pada apakah agent diberi kesempatan memeriksa pekerjaannya sendiri.
Yang perlu diperhatikan pada benchmark semacam ini
Kartu skor penambalan kerentanan AI bermunculan tahun ini, dan metodologinya sangat beragam. Tulisan ini pada dasarnya memberi pembaca sebuah daftar periksa: berapa banyak sampel yang dipakai, apakah ada prompt yang sengaja dirancang menyesatkan, apakah model diizinkan mengompilasi dan menguji, apakah pengaturan reasoning konsisten antar-model, dan apakah ada garis dasar manusia sebagai pembanding. Jika satu saja dari lima hal ini hilang, persentase yang dipublikasikan tidak cukup untuk dijadikan dasar pemilihan tool.
Yang lebih praktis, kedua skill ini sudah dirilis secara publik dan bisa langsung dipasang ke alur code review yang sudah ada tanpa perlu menunggu izin siapa pun. Seberapa besar manfaatnya setelah dipasang sangat bergantung pada codebase masing-masing, dan belum ada jawaban pasti untuk itu.
Sumber: Blog resmi Trail of Bits, CocoLoop, laporan benchmark 1Password; keempat keberatan metodologis, hitungan tambalan 3.067 berbanding 2.634, serta data penggabungan Patch the Planet 186/126 semuanya mengikuti tulisan blog asli.