AI Hasil Latihan Kurang dari $8.000 Kalahkan Juara Stratego

Peneliti dari MIT, Carnegie Mellon University (CMU), New York University, dan Stanford mempublikasikan makalah di jurnal Nature pada 30 September, memperkenalkan sistem AI bernama Ataraxos. Dalam permainan papan strategi Stratego, AI ini mengalahkan Pim Niemeijer — yang dianggap sebagai pemain manusia dengan catatan prestasi terbaik dalam sejarah permainan ini — dengan skor 15 menang, 1 kalah, dan 4 seri.

Biayanya sangat rendah. Menurut konfigurasi yang dijabarkan dalam makalah tersebut, model reinforcement learning dilatih menggunakan 16 unit GPU H100 selama satu minggu, sementara model keyakinan (belief model) yang dipakai untuk menebak identitas bidak lawan dilatih dengan 4 unit H100 selama empat hari. Dengan harga tahun 2025, total biayanya kurang dari $8.000.

Mengapa Stratego Sulit

Stratego adalah permainan perang dua pemain di mana masing-masing pihak menguasai 40 bidak. Di awal permainan, setiap bidak menghadap ke arah yang berlawanan dari lawan — siapa yang menjadi marsekal, bidak mana yang berupa bom, dan di mana bendera disembunyikan, semuanya tidak terlihat sampai bidak itu terlibat pertarungan. Tim peneliti memperkirakan jumlah kemungkinan susunan bidak melebihi 10 pangkat 66.

Ini berbeda dari Go dan catur, yang merupakan permainan dengan informasi sempurna — semua yang ada di papan terlihat oleh kedua pemain. Stratego mengharuskan pemain menebak susunan tersembunyi lawan sekaligus mengendalikan seberapa banyak informasi yang dibocorkan, serta tahu kapan harus menggertak. Permainan dengan informasi tidak lengkap seperti ini secara struktural lebih mirip dengan masalah dunia nyata seperti negosiasi, lelang, dan pertahanan siber, dan sudah lama menjadi tantangan besar dalam riset AI.

Gabriele Farina, penulis senior makalah ini dan profesor di Departemen Teknik Elektro dan Ilmu Komputer MIT, menggambarkan gaya bermain Ataraxos seperti ini:

"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."

(Ataraxos pandai menghitung risiko dengan cara yang tidak bisa dilakukan manusia... tidak bereaksi berlebihan hingga membocorkan rahasianya sendiri)

Dibandingkan dengan DeepNash

Standar sebelumnya di Stratego adalah DeepNash buatan DeepMind yang dirilis pada 2022. Dilatih lewat self-play berskala besar, AI ini berhasil masuk tiga besar sepanjang sejarah di platform Stratego online Gravon, dan saat itu dianggap sebagai tonggak AI menaklukkan permainan ini.

Pendekatan Ataraxos berbeda. Selain pelatihan, sistem ini menambahkan perencanaan saat pengambilan keputusan (decision-time planning) — artinya setiap kali akan melangkah, ia lebih dulu melakukan pencarian berdasarkan dugaan terhadap bidak lawan, baru kemudian menentukan langkah. Menurut peneliti, AI ini tidak menebak secara sembarangan, melainkan mencari langkah paling aman di antara semua kemungkinan posisi papan.

MetrikAtaraxos dibanding riset sebelumnya
Biaya komputasi pelatihan reinforcement learningsekitar 1/500
Jumlah permainan self-playsekitar 1/30
Jumlah sampel pelatihansekitar 1/100

Dari sisi hasil, selain rekor 15-1-4 melawan Niemeijer, catatan keseluruhan Ataraxos melawan pemain-pemain top level kejuaraan dunia adalah 39 menang dan 2 kalah.

Dari AlphaGo hingga DeepNash, hasil AI permainan dari laboratorium-laboratorium besar dalam beberapa tahun terakhir biasanya datang berbarengan dengan ribuan chip dan pelatihan selama berbulan-bulan — sulit dikejar oleh tim kampus. Ataraxos menekan biaya pelatihan untuk jenis masalah ini hingga ke level yang bisa ditutupi oleh satu hibah riset berskala menengah, menunjukkan bahwa pencarian pada tahap inferensi bisa menggantikan sebagian besar komputasi pada tahap pelatihan. Ini sejalan dengan tren "memindahkan komputasi dari pelatihan ke inferensi" yang terjadi di bidang model bahasa besar dalam beberapa tahun terakhir.

Penulis makalah ini termasuk Samuel Sokota dari CMU (penulis pertama) dan Zico Kolter; Gabriele Farina dan Zhiyuan Fan dari MIT; Eugene Vinitsky dari NYU; serta Hengyuan Hu dari Stanford. Apakah kode dan bobot model akan dibuka untuk umum, serta bagaimana performanya pada permainan informasi tidak lengkap lainnya, tidak disebutkan dalam siaran pers MIT; hal ini masih menunggu materi tambahan dari makalah serta publikasi lebih lanjut dari para penulis.

Sumber: makalah Nature, MIT News Office, Tech Xplore, CocoLoop; konfigurasi pelatihan, dasar perhitungan biaya, dan rekor pertandingan telah diverifikasi berdasarkan makalah, dengan data perbandingan DeepNash mengikuti yang disebutkan dalam makalah.