MiniMax merilis model teks baru, M3.1-Flash-Preview, di dalam produk coding miliknya, MiniMax Code, pada 27 September. Posisi resminya adalah untuk pekerjaan pengembangan sehari-hari, mulai dari memperbaiki bug kecil hingga membangun fitur lengkap. Pada hari yang sama, MiniMax mereset kuota Token Plan untuk semua pengguna dan membagikan kartu reset kuota tambahan; dari 28 September hingga 7 Oktober, poin check-in di MiniMax Code digandakan, berlaku untuk pengguna baru maupun lama, dan poinnya bisa dipakai di semua model.
Saat ini model tersebut hanya bisa diakses lewat dua pintu: langganan Token Plan, atau MiniMax Code itu sendiri. API publik berbayar per-pemakaian belum dibuka.
Yang bisa dipastikan dari dokumentasi
Dokumentasi integrasi platform terbuka MiniMax sudah mencantumkan entri model ini, dan beberapa spesifikasi berikut bisa dipastikan:
- Jendela konteks 1 juta token, ditujukan untuk dokumen panjang, seluruh basis kode, dan sesi agen multi-langkah;
- Kecepatan output diklaim lebih dari 100 token per detik;
- Input mendukung teks, gambar, dan video;
- Parameter "effort" untuk mengatur kedalaman penalaran dalam lima tingkat — low, medium, high, xhigh, dan max — dengan default ke max jika tidak diisi.
Ada satu batasan yang ditulis dengan jelas: penalaran model ini tidak bisa dimatikan. Jika sebuah panggilan mencoba menonaktifkan reasoning, API langsung mengembalikan error 400, dan dokumentasi menyarankan untuk menurunkan effort saja jika ingin mengurangi latensi. Dari sisi integrasi, MiniMax menyediakan dua jenis endpoint, bergaya Anthropic dan bergaya OpenAI, dengan yang pertama ditandai sebagai rekomendasi.
Yang belum diumumkan
Peluncuran kali ini terbilang cukup diam-diam. Media teknologi mencatat bahwa MiniMax tidak mengeluarkan pengumuman resmi, tidak ada model card, laporan evaluasi, maupun harga. Papan peringkat pihak ketiga BenchLM mencatat nol hasil benchmark untuk model ini per 27 September.
Media yang sama juga menemukan sebuah repositori terbatas di Hugging Face bernama MiniMax-M3.1-preview-private, dengan ukuran sekitar 250GB, yang tidak bisa diunduh pihak luar. Apakah ini adalah bobot dari versi preview Flash, dan apakah nantinya akan dibuka sebagai open source seperti M3, MiniMax belum memberikan jawaban. Dokumentasi juga tidak memberikan angka soal berapa banyak komputasi yang dihabiskan tiap tingkat effort atau seberapa besar perbedaan latensinya.
Ritme rilis yang berbeda dari M3
M3, yang dirilis 1 Juni, memakai strategi berbeda: bobot open-source, konteks 1 juta token, dan multimodalitas native diluncurkan bersamaan, dilengkapi arsitektur sparse attention buatan sendiri bernama MSA serta satu set lengkap benchmark coding — 59,0% di SWE-Bench Pro dan 66,0% di Terminal-Bench 2.1. Saat itu MiniMax menjadikan "konteks satu juta token yang terjangkau" sebagai jualan utama, lengkap dengan banyak angka pendukung.
M3.1-Flash-Preview justru mengambil jalur produk dulu, dokumentasi belakangan: pengguna berbayar langsung bisa memakainya di MiniMax Code, sementara reset kuota dan kampanye check-in dipakai untuk menarik pengguna kembali. Kata "Flash" dan "Preview" dalam namanya juga menunjukkan posisinya — satu menandakan tingkatan ringan yang mengutamakan kecepatan, satu lagi menandakan sesuatu yang belum final.
Pola semacam ini belakangan cukup umum di kalangan model coding asal Tiongkok. MiMo-V2.6 dari Xiaomi dipecah menjadi tingkat Pro dan Flash, dengan Flash mengambil jalur efisiensi; DeepSeek v4.1 Flash menyebar lewat kuota gratis yang dibagikan alat coding OpenCode dari luar negeri; Zhipu AI juga punya GLM-5.3-Flash. Pengguna alat coding paling sensitif terhadap harga dan kecepatan respons, sehingga merilis tingkat ringan lebih dulu lalu melengkapi benchmark belakangan bisa lebih cepat mendapatkan umpan balik pemakaian nyata.
Bagi pengembang di Tiongkok yang ingin mencoba model ini sekarang, dibutuhkan langganan Token Plan atau langsung memakai MiniMax Code. Effort secara default berada di tingkat tertinggi, jadi untuk sekadar memperbaiki bug kecil, menurunkan satu-dua tingkat secara manual akan membuat respons lebih cepat dan lebih hemat kuota. Soal seberapa cepat dibanding M3, dan apakah kualitas kode ikut menurun, semuanya masih harus menunggu evaluasi dari MiniMax sendiri atau hasil benchmark pihak ketiga.
Sumber: akun media sosial resmi MiniMax, dokumentasi integrasi platform terbuka MiniMax, AlphaSignal, CocoLoop, BenchLM; panjang konteks, tingkat effort, dan batasan integrasi diverifikasi berdasarkan dokumentasi MiniMax, sementara angka benchmark M3 dilaporkan sendiri oleh vendor.