Xiaomi perbaiki panggilan tool MiMo yang berulang, hanya $90 ribu

Tim MiMo Xiaomi merilis tulisan teknis pada 27 September yang mengulas kembali keluhan yang berulang kali disampaikan pengembang setelah MiMo-V2.6 diluncurkan: di dalam coding agent, model terus-menerus mengeluarkan panggilan tool yang sama atau hampir sama, menghabiskan context dan komputasi sementara tugasnya sama sekali tidak maju. Bobot model yang sudah diperbaiki telah dirilis sebagai open source dengan nama file berakhiran MOPD. Platform API sudah beralih ke versi baru sejak pukul 6 pagi waktu Beijing pada 25 September, dan sebagai kompensasi, sisa kuota pengguna MiMo Desktop untuk periode berjalan direset seluruhnya.

Memisahkan "terlalu banyak panggilan" dari "panggilan yang berulang"

Tulisan itu tidak menganggap semua kasus panggilan berlebih sebagai cacat. Xiaomi membaginya menjadi tiga kategori: panggilan paralel, yaitu optimasi normal ketika beberapa panggilan masing-masing mengambil informasi berbeda; panggilan berlebihan, yaitu jumlah panggilan yang melebihi kebutuhan tugas; dan panggilan berulang, yaitu ketika kondisi lingkungan maupun informasi yang sudah diketahui tidak berubah, tetapi model tetap mengulang aksi yang sama. Kategori ketiga inilah yang menjadi sasaran perbaikan tim.

Menurut evaluasi internal Xiaomi, tingkat pengulangan pada level balasan melampaui ambang toleransi 0,05%, dengan perbedaan cukup besar antar lingkungan:

LingkunganFlashPro
OpenCode1,02%0,54%
Claude Code0,27%0,10%
MiMo Desktop0,19%0,19%
MiMo Code0,11%0,07%

Model Flash di OpenCode mencatat angka paling buruk, kira-kira 1 dari 100 balasan berputar di tempat.

Akar masalah ada di tahap reinforcement learning

Tim memutar ulang setiap checkpoint selama proses reinforcement learning dan menemukan bahwa proporsi sampel satu giliran dengan lebih dari sepuluh panggilan terus naik dari 11,1% pada langkah ke-0 menjadi 24,6% pada langkah ke-20; di lingkungan MiMo Code kenaikannya lebih tajam lagi, dari 30,6% menjadi 41,7%. Proses pelatihan sebenarnya sudah memiliki mekanisme penalti, tetapi hanya berlaku jika satu giliran melebihi 32 panggilan. Sejak langkah ke-15, sampel yang memicu penalti ini meningkat cukup jelas, menandakan ambang batas 32 terlalu longgar untuk mencegah model membentuk kebiasaan "menambah beberapa panggilan lagi tidak ada ruginya".

Tulisan itu memberikan satu angka yang cukup mencolok: sebelum diperbaiki, pada titik panggilan tool ke-12, probabilitas model memilih untuk terus memanggil mencapai 94,56%, sementara probabilitas memilih berhenti hanya 5,43%. Singkatnya, model hampir tidak pernah berhenti dengan sendirinya.

Dua cara perbaikan, bedanya satu tingkat besaran

Cara paling langsung adalah menurunkan ambang batas penalti dari 32 panggilan menjadi 8 panggilan, lalu melatih ulang dengan alur MixRL yang sudah ada. Dalam pengujian internal, tingkat pengulangan turun dari 13,45% menjadi 3,83%, tetapi ini berarti harus mengembalikan pelatihan 20 langkah ke belakang dan melatih ulang dari titik itu, dengan perkiraan biaya sekitar $2,31 juta menurut Xiaomi, dan hasilnya belum tentu stabil jika dataset yang dipakai berbeda.

Pendekatan yang akhirnya dipakai disebut MOPD, atau distilasi daring multi-guru. Caranya adalah mengambil sampel pengulangan yang sudah dikumpulkan secara internal, lalu melatih sebuah model guru reinforcement learning khusus yang tugasnya hanya mempelajari "kapan harus berhenti" — hanya 12 langkah pelatihan dengan sekitar 7.000 sampel. Model utama kemudian dikembalikan 5 langkah dan melanjutkan pelatihan di bawah bimbingan guru tersebut. Total biayanya sekitar $90 ribu, kira-kira 4% dari opsi pertama.

Dari sisi hasil, probabilitas berhenti pada panggilan ke-12 naik dari 5,43% menjadi 92,17%. Berdasarkan kurva probabilitas berhenti kumulatif yang ditampilkan dalam tulisan itu, sebelum perbaikan model baru mencapai probabilitas berhenti di atas 50% pada panggilan ke-59; setelah perbaikan, angka itu sudah mencapai 99,87% pada panggilan ke-8. Xiaomi menyebutkan tingkat pengulangan turun tajam di semua platform, hasilnya konsisten pada berbagai panjang context, dan skor benchmark secara keseluruhan tidak menurun.

Dilihat kembali dalam alur V2.6

MiMo-V2.6 diluncurkan dan dirilis sebagai open source pada 22 September. Saat itu, yang paling ditekankan Xiaomi adalah skala post-training: menurut angka yang diberitakan media, Pro dan Flash masing-masing menjalani 30 langkah reinforcement learning, dengan total biaya sekitar $3,5 juta. Lima hari kemudian, tulisan evaluasi ini secara terbuka membeberkan efek samping dari proses pelatihan tersebut, bahkan mencantumkan bahwa opsi yang tidak dipilih bisa saja menelan biaya tambahan $2,31 juta.

Tidak banyak tim pengembang model dalam negeri yang secara terbuka mengevaluasi insiden pascapeluncuran, dan lebih jarang lagi yang turut mencantumkan biaya dari opsi yang gagal dipilih. Bagi pengembang yang menghubungkan model buatan China ke OpenCode atau Claude Code, hal yang lebih praktis adalah: jika beberapa hari terakhir Anda menemukan MiMo berulang kali membaca ulang file yang sama atau menjalankan ulang perintah yang sama, API saat ini sudah menggunakan versi yang telah diperbaiki; pengguna yang menjalankan sendiri (self-hosted) perlu berpindah ke bobot dengan akhiran MOPD. Semua angka tingkat pengulangan yang disebutkan di sini berasal dari evaluasi internal Xiaomi, dan hasil pengujian ulang dari pihak ketiga belum dipublikasikan.

Sumber: Blog teknis Tim MiMo Xiaomi, CocoLoop; tingkat pengulangan dan panggilan berlebihan per lingkungan, serta perkiraan biaya kedua opsi perbaikan, mengacu pada evaluasi internal Xiaomi.