Sistem Multi-Agen Google Pecahkan Lima Soal Terbuka Matematika

Tujuh peneliti dari Google Research mengirimkan makalah ke arXiv pada 30 September, memperkenalkan sistem multi-agen bernama Cogentic yang dirancang khusus untuk mencari bukti matematis setingkat riset. Menurut makalah tersebut, sistem ini menggunakan Gemini sebagai model dasar dan berhasil memajukan 5 soal terbuka di tiga bidang: pembelajaran daring, teori lelang, dan desain mekanisme. Semua bukti kemudian diverifikasi secara independen oleh pakar di bidangnya, lalu dikembangkan menjadi makalah lengkap dengan pakar tersebut sebagai co-author.

Daftar penulis mencakup Yang Cai, yang juga menjabat di Yale University, dan Vineet Gupta, yang juga terafiliasi dengan Google DeepMind, bersama Aranyak Mehta, Christopher Liaw, Di Wang, dan lainnya. Makalah ini dikategorikan dalam cs.AI dan cs.GT (teori permainan).

Satu Kali Generasi Tidak Cukup, Maka Dipecah Jadi Pipeline

Titik tolak makalah ini sederhana: model bahasa sudah mampu menghasilkan ide matematis yang cukup baik, tetapi untuk soal sulit yang membutuhkan pengujian beberapa dugaan sekaligus dan dikerjakan terus-menerus selama berhari-hari, satu kali proses generasi saja tidak cukup.

Cogentic membagi proses pencarian bukti ke beberapa peran berbeda:

  • Orchestrator memegang status global dan menentukan berapa banyak prover yang dikirim ke arah mana;
  • Prover menulis kandidat bukti secara paralel;
  • Verifier mencari kesalahan dari sudut pandang yang saling melengkapi, bersifat adversarial;
  • Literature retriever melengkapi materi latar belakang;
  • Ledger hanya mencatat kesimpulan antara yang sudah lolos verifikasi, disimpan lintas putaran sehingga bukti berikutnya bisa langsung mengutipnya;
  • Ada juga peran "advisor" yang mengawasi pola dari keseluruhan proses dan menyesuaikan parameter kapan saja.

Membuktikan, memverifikasi, membuktikan lagi — siklus ini terus berputar. Mekanisme ledger ini mengatasi masalah klasik pada tugas jangka panjang: lemma yang dihasilkan model pada putaran sebelumnya sering terlupakan atau berubah rumusannya pada putaran berikutnya. Kini, begitu lolos verifikasi, hasilnya langsung dikunci.

Sejauh Mana Masing-Masing dari Lima Soal Ini Maju

Berdasarkan hasil yang diberikan makalah:

  1. Optimisasi linier invers daring: untuk pertama kalinya diperoleh batas regret O(d) yang efisien dan tidak bergantung pada horizon waktu T, dengan komputasi O(d²) per putaran;
  2. Kompleksitas kompetitif pasar dua sisi: dibuktikan bahwa dengan hanya menambahkan 2 penjual di sisi yang lebih kecil, pendapatan transaksi bisa menyamai alokasi optimal;
  3. Regret anytime untuk n pakar: diberikan algoritme anytime dengan suku konstanta yang sama dengan versi horizon tetap;
  4. Mekanisme sederhana versus pendapatan optimal: rasio aproksimasi pendapatan untuk satu pembeli aditif membaik dari 5,2 menjadi 3,52;
  5. Price of anarchy untuk penawaran otomatis: mencapai nilai optimal 1,5 untuk 2 penawar, dan 2−1/(4n+1) untuk n penawar.

Soal biaya, makalah menyebutkan sebagian besar soal membutuhkan pemanggilan Gemini pada skala ratusan kali, sedangkan yang paling sulit pada skala ribuan kali; versi Gemini yang digunakan tidak disebutkan secara spesifik.

Dibandingkan dengan Rangkaian Bukti dari OpenAI

Paruh kedua tahun ini dipenuhi berita tentang AI yang mengerjakan matematika, dan jika disandingkan, perbedaannya ada pada jalur verifikasinya.

Pada Agustus, OpenAI dengan Astra menghasilkan 10 hasil di bidang matematika dan ilmu komputer teoretis, dilengkapi makalah 249 halaman dan sertifikat formalisasi Lean. Bukti Navier–Stokes yang diumumkan pada September menggunakan sekitar sepuluh ribu agen yang berjalan selama 88 jam, juga disertai berkas Lean. Sertifikat formal yang bisa diperiksa mesin adalah nilai jual yang terus ditekankan OpenAI pada jalur ini.

Makalah Cogentic menitikberatkan hal lain: di dalam sistem, verifier adversarial menyaring satu putaran, lalu setelah keluar dari sistem, orang yang memahami bidangnya membaca satu per satu, kemudian menulis bersama pakar menjadi makalah resmi. Skala soalnya juga lebih sempit — kelima soal berasal dari bidang riset penulisnya sendiri, soal yang memang diawasi orang dalam bidang tersebut dan hasilnya bisa dinilai oleh sesama peneliti.

Pendekatan ini membuat hasilnya lebih mudah diakui, dengan konsekuensi pada generalisasinya. Makalah ini sendiri mengakui bahwa soal-soalnya "dipilih dari bidang yang dikuasai penulis," dan tidak menjawab bagaimana hasilnya jika diterapkan pada arah yang tidak dikuasai penulis.

Pembaca Tak Mampu Mengimbangi Kecepatan Penulisan

Ada satu kalimat dalam makalah ini yang hampir sama persis dengan kekhawatiran Terence Tao dalam tulisannya pada Agustus:

"A system like this can produce candidate results faster than they can be read."

Sistem seperti ini bisa menghasilkan kandidat hasil lebih cepat daripada kecepatan orang membacanya.

Kelima soal Cogentic masing-masing sudah diperiksa pakar, sehingga bisa disebut "terverifikasi." Namun begitu orkestrasi semacam ini dibuka untuk lebih banyak orang dan soal yang lebih luas, kemacetan akan berpindah ke tangan para pemeriksa. Makalah ini tidak menyebutkan berapa lama waktu yang dibutuhkan pakar untuk memverifikasi tiap bukti — padahal itulah angka yang menentukan seberapa jauh pendekatan ini bisa diskalakan.

Sumber: makalah arXiv 2609.40324, CocoLoop, Google Research; semua batas, rasio aproksimasi, dan skala jumlah pemanggilan untuk kelima hasil mengikuti teks asli makalah.