Benchmark Baru Microsoft: Agen AI Dijalankan 20 Kali, Kurang dari Separuh Konsisten

Microsoft dan Hugging Face bersama-sama merilis ThinkingBox, kerangka evaluasi agen AI, beserta benchmark pendampingnya, ThinkingBox-Bench. Penilaiannya didasarkan pada apa yang sebenarnya terjadi di database backend setelah agen menyelesaikan tugasnya — bukan pada teks di mana agen itu sendiri melaporkan "tugas selesai".

Benchmark ini terdiri dari 507 tugas proses bisnis yang bersifat stateful, tersebar di lima industri: ritel 98 tugas, asuransi mobil 100 tugas, perjalanan 104 tugas, perbankan digital 104 tugas, dan konsultasi 101 tugas. Setiap tugas dijalankan secara independen 20 kali pada backend yang bersih, dan skrip pemeriksaan yang bisa dieksekusi memverifikasi kondisi akhir database serta efek sampingnya — apakah field yang seharusnya berubah benar-benar berubah dengan tepat, dan apakah agen secara tidak sengaja mengubah catatan yang seharusnya tidak disentuh.

Tim merangkum masalah ini dalam satu kalimat di blog mereka:

"The Agent Said It Was Done. The Database Disagreed."

(Agen mengatakan tugasnya sudah selesai. Database tidak setuju.)

Hasil dari 18 Model

Ada 18 model yang diuji, mencakup sistem tertutup maupun bobot terbuka. Berdasarkan ukuran "lolos semua 20 kali", Claude Opus 5.5 dan Claude Opus 5 berbagi posisi pertama, masing-masing berhasil menyelesaikan 241 tugas secara konsisten — 47,53%. GPT-6 Astra berada di posisi ketiga dengan 231 tugas, atau 45,56%. Artinya, model dengan performa terbaik pun gagal mencapai hasil yang benar setiap kali pada lebih dari separuh tugas.

Cakupan paling luas dimiliki Kimi-K3: dari 507 tugas, 476 tugas berhasil dijawab benar setidaknya sekali, dengan tingkat keberhasilan 93,89%. Namun hanya 68 tugas yang benar di semua 20 kali percobaan. Model yang sama terlihat hampir serba bisa jika dilihat dari pass@20, tetapi berada di posisi belakang dari segi keandalan — selisih tujuh kali lipat antara dua angka tersebut.

Rincian penyebab kegagalan lebih spesifik. Dari 79.853 percobaan yang "berjalan normal tetapi hasilnya salah", 77,61% melibatkan nilai field yang ditulis secara salah, dan 43,30% menyebabkan efek samping yang tidak diinginkan (kedua hal ini bisa terjadi bersamaan). Penilaian tim: sekitar 80% kegagalan berasal dari tahap pemanggilan tool, misalnya parameter yang salah atau urutan pemanggilan yang tidak tepat, sementara kesalahan pada penalaran itu sendiri menyumbang porsi yang jauh lebih kecil.

Tim juga melaporkan angka "biaya per tugas yang andal" — rata-rata biaya untuk menyelesaikan satu tugas secara konsisten di 20 kali percobaan: 6,80 dolar AS untuk GPT-5.4, 7,45 dolar AS untuk GPT-6 Astra, dan 7,80 dolar AS untuk Claude Opus 5.5. GPT-5.4 dari generasi lama justru mengungguli model-model yang lebih baru pada metrik ini.

Dibandingkan dengan Benchmark Agen AI yang Sudah Ada

ThinkingBox bukan yang pertama mengukur keandalan lewat percobaan berulang. τ-bench milik Sierra, yang dirilis pada 2024, memperkenalkan metrik pass^k, yang mensyaratkan model berhasil pada tugas yang sama sebanyak k kali berturut-turut, saat itu mencakup skenario ritel dan penerbangan. Perbedaan ThinkingBox terletak pada skala dan cara penilaian: jumlah tugas diperluas menjadi 507 di lima industri, dan efek samping diperlakukan sebagai kondisi kegagalan tersendiri. Dalam aturan τ-bench, agen yang mengubah satu catatan tambahan yang tidak relevan belum tentu dikenai pengurangan nilai.

Situs ini sebelumnya pernah membahas benchmark Vero dari Berkeley, yang meminta agen menyelesaikan 43 proyek perangkat lunak — skor terbaik sejauh ini adalah 27 proyek selesai. Benchmark itu mengukur "seberapa besar pekerjaan yang bisa diselesaikan sekali jalan". Arah pertanyaan ThinkingBox justru sebaliknya: tugas-tugas individualnya tidak sulit, yang dilihat adalah apakah tugas yang sama, jika diberikan 20 kali, akan menghasilkan setidaknya satu kegagalan. Dalam proses bisnis perusahaan, jenis kegagalan kedua ini sering kali lebih berbahaya — satu kali kesalahan pada jumlah polis asuransi atau field transfer dana jauh lebih mahal untuk diperbaiki daripada sekadar tidak menyelesaikan tugas.

Cara Menggunakannya

Kodenya open source dengan lisensi MIT, data benchmark menggunakan CDLA-Permissive-2.0, dan lingkungan OpenEnv menggunakan BSD-3-Clause — bisa langsung dijalankan melalui antarmuka OpenEnv di Hugging Face. Penerapan secara lokal membutuhkan Docker dan Typesense untuk mengelola state, tool disediakan melalui server MCP, dan tiga endpoint model perlu dikonfigurasi: agen yang diuji, pengguna simulasi, dan model penilai.

Baik pengguna simulasi maupun penilai diperankan oleh model, yang dengan sendirinya juga membawa margin kesalahan. Blog tidak mengungkapkan secara terpisah seberapa tinggi tingkat kesesuaian penilaian model penilai dengan anotasi manusia. Sebelum angka ini tersedia, selisih satu atau dua poin persentase antar-model sebaiknya tidak ditafsirkan secara berlebihan. Proyek ini juga melibatkan mahasiswa magang dari University of Pittsburgh, UC Irvine, Northwestern University, dan Columbia University.

Sumber: Blog Hugging Face, Microsoft Research, CocoLoop, makalah Sierra τ-bench; jumlah tugas yang lolos per model, rasio jenis kegagalan, dan biaya per tugas mengikuti data yang dipublikasikan oleh tim ThinkingBox.