Mistral merilis Agentic Search, mengubah pencarian dokumen dari pengambilan sekali jalan menjadi proses bertahap. Sistem ini memberi model lima alat: search, open, navigate, read, dan grep. Model bisa mencari sekali dulu, membuka file yang cocok, menuju ke bagian tertentu, membacanya, dan jika hasilnya terasa keliru, mengubah kata kunci lalu mencari ulang — baru menjawab setelah yakin.
Peningkatan pada dua tolok ukur ini cukup besar. FinanceBench, yang memakai dokumen SEC perusahaan publik AS, mencatat akurasi naik dari 26,7% menjadi 86% — lebih dari tiga kali lipat. OfficeQA Pro, yang memakai buletin Departemen Keuangan AS, naik dari 6,3% menjadi 51,9%, kenaikan 45,6 poin persentase.
Di mana pencarian sekali jalan macet
Alur RAG standar adalah memecah dokumen jadi potongan, menghitung vektor, mengambil beberapa potongan paling mirip dengan pertanyaan, lalu menempelkannya ke konteks agar model bisa menjawab. Alur ini cukup untuk pertanyaan seperti "berapa pendapatan perusahaan pada tahun tertentu", tapi mulai gagal untuk pertanyaan seperti "sebutkan arus kas bebas selama tiga tahun terakhir dan jelaskan perubahan basis perhitungannya".
Kegagalan ini sudah tertanam sejak tahap pemotongan dokumen. Satu angka dalam laporan keuangan sering kali baru bisa dibaca dengan benar lewat tiga hal: nilai di dalam tabel, catatan kaki di bawahnya, dan penjelasan basis akuntansi di bagian sebelumnya. Ketiganya bisa terpisah puluhan halaman, dan pengambilan berbasis vektor mengurutkan berdasarkan kemiripan makna — catatan kaki dan penjelasan basis biasanya tidak cukup mirip untuk masuk urutan atas. Model pun hanya mendapat satu angka yang berdiri sendiri, membacanya apa adanya, dan tidak tahu kalau salah.
Pencarian bertahap mengembalikan proses ini ke cara orang membolak-balik dokumen. Cari lokasi dulu, lalu buka lebih lanjut, dan kalau ada tulisan "lihat Catatan 12", langsung lompat ke sana lalu kembali lagi. Keberadaan grep sebagai alat ini sendiri sudah menunjukkan sesuatu: pencarian vektor unggul dalam pencocokan makna yang samar, tapi untuk string persis seperti "Note 12", pencocokan teks penuh cara lama justru lebih bisa diandalkan. Kedua metode pencarian ini masing-masing menangani bagiannya dalam satu set alat yang sama.
Ada juga manfaat tersembunyi yang mudah terlewat. Jawaban dari pencarian sekali jalan tidak bisa dilacak balik — kalau model bilang pendapatannya sekian, dan pengguna ingin tahu angka itu diambil dari halaman mana, mereka harus membuka sendiri dokumennya. Setiap langkah dalam pencarian bertahap adalah pemanggilan alat yang eksplisit: file mana yang dibuka, bagian mana yang dituju, string apa yang cocok — semuanya tersimpan dalam jejak. Untuk kasus keuangan dan hukum, jejak ini sendiri adalah bagian dari hasil kerja: menjawab benar saja tidak cukup, harus bisa dibuktikan juga kenapa jawabannya benar.
Makin banyak putaran justru makin hemat
Secara nalar, operasi bertahap seharusnya berarti lebih banyak putaran, lebih banyak token, dan waktu tunggu lebih lama. Angka dari Mistral justru sebaliknya: penggunaan token turun hingga 33,7%, dan latensi P90 turun 39,6%, membuat FinanceBench yang tadinya 255 detik menjadi 154 detik.
Angka-angka ini berlaku dengan syarat: dibandingkan dengan apa. RAG sekali jalan cenderung memperbesar jumlah potongan yang diambil demi menjaga cakupan, menjejalkan dua puluh sampai delapan puluh potongan ke dalam konteks, padahal sebagian besar tidak relevan dengan pertanyaan. Pencarian bertahap hanya membaca bagian yang dibutuhkan di setiap putaran; jumlah putarannya memang lebih banyak, tapi input tiap putaran pendek, sehingga totalnya justru lebih hemat.
Soal latensi lebih bergantung pada implementasi teknis. P90 yang turun berarti kasus-kasus ekor panjang — "pencarian gagal, model mengarang jawaban, hasilnya melenceng jauh, perlu diulang" — jadi lebih sedikit. Kegagalan pada pencarian sekali jalan sifatnya diam-diam; model tidak tahu kalau dirinya tidak mendapatkan catatan kaki yang dibutuhkan. Dalam pencarian bertahap, model bisa menyadari kalau belum menemukan yang dicari lalu mencari lagi, sehingga ekor panjang itu justru menyempit.
Dua kendala saat masuk ke dokumen berbahasa Mandarin
Mistral menyediakan ini dalam bentuk Search Toolkit dan Libraries, yang sudah terintegrasi ke Studio dan Vibe, dan mendukung penerapan di cloud maupun on-premise. Dukungan on-premise ini jadi kebutuhan mutlak bagi sektor seperti keuangan, kesehatan, dan pemerintahan yang tidak boleh mengirim dokumen ke luar sistem mereka, dan Mistral selalu menjadikan ini sebagai pembeda dari vendor asal AS.
Ketika dipindahkan ke dokumen berbahasa Mandarin, sistem ini menghadapi dua masalah baru. Pertama, bahasa Mandarin tidak punya batas kata yang jelas, sehingga keunggulan grep dalam pencocokan persis lebih kecil dibanding bahasa Inggris, dan perhitungan kasar menunjukkan noise pada hasil pencocokan bakal jauh lebih tinggi. Kedua, prospektus, laporan tahunan, dan dokumen kebijakan di Tiongkok banyak memakai hasil pindaian (scan) dan tabel non-standar — kemampuan langkah read merekonstruksi struktur tabel ini yang langsung menentukan apakah langkah-langkah berikutnya benar-benar "membaca" atau sekadar "menebak".
Hal lain yang perlu diperhatikan adalah tolok ukurnya sendiri. FinanceBench dan OfficeQA Pro sama-sama kumpulan soal publik — pertanyaan dan dokumennya sudah lama beredar di internet, sehingga vendor mana pun yang menguji sistemnya sendiri di sana berisiko terkena kontaminasi data pelatihan. Titik awal 26,7% ini tergolong rendah sampai terasa mencolok, dan pengumuman resminya tidak merinci konfigurasi RAG seperti apa yang jadi pembanding, berapa jumlah potongan yang diambil, atau model dasar apa yang dipakai. Arah peningkatannya bisa dipercaya, tapi angka kelipatannya perlu dilihat dengan sedikit diskon.
Harga belum diumumkan. Bagi pembeli enterprise, ini poin yang berat: setiap kueri pencarian bertahap memicu beberapa kali pemanggilan model, dan kalau tarifnya dihitung per panggilan, mencapai akurasi 86% itu bisa berarti biaya beberapa kali lipat dari harga per kueri — perhitungan biayanya harus dihitung ulang.
Sumber: pengumuman resmi Mistral, CocoLoop; angka akurasi FinanceBench dan OfficeQA Pro, penghematan token, serta latensi P90 diperiksa satu per satu.