Tim riset Google mengirimkan paper ke arXiv pada 1 Oktober, memublikasikan kerangka verifikasi agen bernama VeriHarness, dengan kode yang dirilis bersamaan di GitHub di bawah lisensi Apache 2.0. Masalah yang ingin dipecahkan cukup konkret: ketika sebuah agen AI menjalankan tugas panjang yang memakan puluhan langkah dan menyerahkan spreadsheet, laporan, atau file yang sudah diedit, siapa yang menentukan hasil itu benar atau tidak.
Cara kerja VeriHarness adalah membuat model yang sama yang menghasilkan jawaban itu bertindak sebagai pemeriksa ulang bagi dirinya sendiri. Model dijalankan beberapa kali secara independen pada soal yang sama, menghasilkan beberapa hasil, yang kemudian dibandingkan berdampingan dan dikelompokkan menjadi dua kategori — 'perbedaan pendapat' dan 'kesepakatan' — yang masing-masing ditangani secara berbeda.
Dua jalur pemeriksaan ulang
Jalur pertama menangani perbedaan pendapat. Ketika beberapa hasil tidak sepakat pada satu kesimpulan, pemeriksa kembali ke lingkungan tugas untuk mencari bukti — membuka ulang file asli, memeriksa sel tertentu di spreadsheet — dan memakai apa pun yang bisa diverifikasi di lingkungan itu untuk menyingkirkan klaim yang salah.
Jalur kedua menangani kesepakatan. Meski beberapa hasil sudah sepakat, kerangka ini tidak langsung meloloskannya. Ia secara aktif mencari celah, khusus mencari bukti yang bisa membatalkan kesimpulan bersama itu, sekaligus memeriksa apakah semua hasil sama-sama melewatkan satu persyaratan dalam tugas. Premis paper ini adalah bahwa beberapa kali berjalan dan mendapat jawaban yang sama tidak menjamin jawaban itu benar — model bisa saja membuat kesalahan yang identik setiap kali.
Setelah kedua jalur selesai, prosesnya masuk ke tahap putusan: pemeriksa memilih hasil terbaik sebagai dasar, merevisinya berdasarkan bukti yang sudah dikumpulkan, mengulang seluruhnya dari awal bila perlu, dan mencatat secara terpisah pertanyaan yang masih belum terjawab. Kerangka ini melengkapi pemeriksa dengan ruang kerja, alat pengumpulan bukti, dan sekumpulan 'keterampilan verifikasi' yang bisa dipakai ulang, yang menurut paper ini bisa memperbaiki dirinya sendiri berdasarkan umpan balik dari kegagalan.
Apa yang diuji, dan seberapa besar peningkatannya
Evaluasi ini mencakup lima benchmark ruang kerja jangka panjang: APEX-Agents, Workspace-Bench Lite, WorkBuddy Bench, SpreadsheetBench 2, dan JobBench — sebagian besar berupa tugas yang mengharuskan penyerahan file jadi, seperti dokumen kantor, spreadsheet, atau berkas lamaran kerja. Model yang sama menangani baik penghasilan jawaban maupun pemeriksaan ulang; dua model diuji, Gemini 3.5 Flash dan Claude Opus 4.8, keduanya diakses lewat Vertex AI.
Menurut paper dan README-nya, VeriHarness menempati posisi pertama untuk 'skor pemilihan' di kelima benchmark, dibandingkan dengan baseline yang mencakup hasil sekali jalan dan metode LLM-as-a-Verifier sebelumnya. Dengan tambahan revisi berbasis bukti, Gemini 3.5 Flash naik rata-rata 6,2 poin dibanding sekali jalan, dan Claude Opus 4.8 naik rata-rata 6,4 poin.
Tim ini juga merilis sekitar 26 ribu jejak eksekusi di Hugging Face — kedua model dijalankan 10 kali per soal di kelima benchmark, lengkap dengan proses eksekusi yang sudah dirender, file yang diserahkan, dan skornya. Input dan jawaban acuan dari benchmark tersebut tidak dirilis. Paper ini menyebut bahwa menghasilkan dataset ini menghabiskan biaya lebih dari 100.000 dolar AS.
Bedanya dengan "jalankan beberapa kali lalu ambil suara terbanyak"
Menjalankan model beberapa kali lalu memilih jawaban lewat voting adalah cara umum di industri untuk mendongkrak akurasi — murah, mudah diterapkan, dan efektif untuk tugas tanya jawab singkat. Pada tugas panjang, cara ini menemui dua masalah: hasil akhirnya berupa file, yang tidak bisa sekadar divoting; dan ketika beberapa hasil sepakat, voting justru mempertahankan kesalahan bersama itu apa adanya. Kedua jalur VeriHarness dirancang khusus untuk mengatasi dua masalah ini.
Cara umum lainnya adalah menjadikan satu model sebagai juri, yang membaca beberapa hasil lalu langsung memberi skor. Cara ini bergantung pada pembacaan dan penilaian juri tersebut, dan tidak pernah kembali memeriksa ke lingkungan tugas. VeriHarness menempatkan "apakah klaim bisa didukung bukti yang ditemukan di lingkungan tugas" sebagai intinya, dengan konsekuensi langkah pemeriksaan ulang itu sendiri berubah jadi tugas agen yang memanggil alat dan menghabiskan token. Paper ini tidak memberi angka berapa besar biaya tambahan pemeriksaan ulang dibanding proses menghasilkan jawaban — untuk saat ini, perusahaan yang ingin menghitung biaya itu harus mengukurnya sendiri.
Media ini sebelumnya pernah mengulas benchmark ThinkingBox dari Microsoft, yang mengulang tugas yang sama 20 kali untuk melihat seberapa stabil hasil sebuah agen. Kedua karya ini menunjuk ke arah yang sama: pada tugas panjang, skor dari satu kali jalan punya nilai acuan yang terbatas, dan variasi antar beberapa kali eksekusi itu sendiri adalah sebuah sinyal — satu pihak memakainya untuk mengukur stabilitas, pihak lain untuk menangkap kesalahan.
Apakah sudah bisa langsung dipakai
README-nya menyebutkan lingkungan yang dibutuhkan adalah Linux, dengan Python 3.10 atau lebih baru, Node.js 22.19 atau lebih baru, Docker, dan unprivileged user namespace; di baliknya, ini berjalan di atas runtime open source bernama pi, sehingga bisa terhubung ke penyedia model apa pun yang didukung pi. Halaman proyeknya juga mencantumkan kalimat ini:
“This is not an officially supported Google product.” (Ini bukan produk yang didukung resmi oleh Google.)
Dengan kata lain, untuk saat ini ini masih berupa kode riset, dan Google tidak berkomitmen untuk memeliharanya. Kedua model yang diuji dalam paper ini juga bukan generasi terbaru dari masing-masing perusahaan, dan para penulisnya belum menguji seberapa besar peningkatan yang masih tersisa jika diganti dengan Gemini 4 atau Opus 5.5 — bagian ini masih harus menunggu reproduksi dari pihak ketiga.
Sumber: paper arXiv “VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks”, halaman proyek GitHub Google Research, CocoLoop, dan halaman dataset Hugging Face; paper dan README-nya diperiksa untuk nama kelima benchmark, rata-rata peningkatan skor kedua model, sekitar 26 ribu jejak eksekusi, dan kebutuhan lingkungan runtime.