Perusahaan AI asal Prancis, Mistral, merilis versi pratinjau riset Mistral Large 4 pada 6 Oktober. Perusahaan memberinya julukan "le Chonk", yang kurang lebih berarti "si gemuk". Model ini merupakan mixture-of-experts (MoE) multimodal native dengan total 1 triliun parameter, sekitar 49 miliar parameter aktif per token, jendela konteks 512K, serta mendukung input teks dan gambar dengan output teks.
Versi pratinjau ini saat ini tersedia melalui Mistral API, dengan prioritas untuk developer, tim keamanan siber, dan lembaga pemerintah. Perusahaan berencana memperluas akses akhir bulan ini dan merilis bobot open source pada akhir Oktober.
Pelatihan dan Posisi
Menurut blog resmi Mistral, Large 4 dilatih dari nol menggunakan pusat data milik perusahaan sendiri di Eropa, dengan sekitar 3.800 unit GPU Nvidia Grace Blackwell; laporan CNBC menyebut proses pelatihan berlangsung sekitar dua bulan. Mistral menempatkan keunggulan model ini pada keamanan siber, coding, manufaktur, keuangan, dan tugas multimodal.
Klaim resmi Mistral menyebut Large 4 sebagai "model open-weight paling mumpuni di luar China, dengan selisih yang jauh." Namun laporan CNBC juga mencatat bahwa Mistral mengakui model ini masih tertinggal dari model closed-source paling mutakhir, termasuk di bidang coding.
API ini menyediakan dua mode penalaran: none dan high. Developer Simon Willison menemukan dalam pengujiannya bahwa mode high justru menghasilkan lebih sedikit token — rata-rata 2.717, dibandingkan 3.275 pada mode none — dan hasil keluaran mode high dinilai lebih baik. Kesimpulan umumnya, Large 4 tertinggal sekitar setengah tahun dari garis terdepan.
Penilaian Pihak Ketiga
Lembaga benchmark independen Artificial Analysis memberikan skor Intelligence Index 38. Berikut perbandingannya:
| Model | Intelligence Index |
|---|---|
| DeepSeek V4.1 Flash | 39 |
| Mistral Large 4 | 38 |
| GPT-6 Luna (max) | 38 |
| Mistral Large 3 | 9 |
Selisih 29 poin antar generasi ini cukup mencolok — skor 9 milik Large 3 generasi sebelumnya tampak jauh tertinggal di tabel ini. Artificial Analysis menyebutnya sebagai "model paling cerdas di luar AS dan China." Indeks keamanan siber dari lembaga yang sama memberi Large 4 skor 50, sementara tingkat kelulusan pada uji penalaran dokumen (GDP.pdf) hanya 19% — titik lemah yang jelas.
Menghitung Biaya
Harga API versi pratinjau ini adalah $1,36 per juta token input dan $4,18 per juta token output, dengan input cache hit $0,14 per juta; ada diskon 50% untuk dua minggu pertama peluncuran. Artificial Analysis, berdasarkan konversi dari rangkaian tugasnya sendiri, mencatat biaya per tugas sebesar $1,13, atau $0,57 selama periode diskon.
Sebagai gambaran kasar: memasukkan 1 juta token berupa basis kode atau dokumen, dan menghasilkan 200 ribu token output, biayanya sekitar $2,2 dengan harga normal, atau sekitar $1,1 selama periode diskon. Harga output sekitar tiga kali lipat harga input, sehingga tugas agentic dengan output panjang akan lebih mahal.
Rasio aktivasi juga layak dihitung. 49 miliar parameter aktif dari total 1 triliun parameter setara sekitar 4,9%, berada di kisaran yang sama dengan Reflection Beam yang dirilis sehari sebelumnya (23 miliar aktif dari total 501 miliar, sekitar 4,6%). Biaya inferensi sebagian besar mengikuti jumlah parameter aktif, itulah sebabnya kedua perusahaan sama-sama menonjolkan soal "efisiensi".
Ambang batas deployment adalah soal lain. Dengan estimasi presisi 8-bit, menyimpan bobot 1 triliun parameter saja membutuhkan sekitar 1TB VRAM, dan setelah kuantisasi 4-bit pun masih sekitar 500GB. Kebanyakan tim yang mendapatkan bobot open source besar kemungkinan tetap harus mengandalkan hosting dari penyedia cloud atau menunggu versi distilasi dari komunitas.
Kartu Eropa
Mistral baru saja menyelesaikan pendanaan senilai 3 miliar euro pada September, dipimpin oleh Samsung. Large 4 adalah produk unggulan pertama setelah dana tersebut cair, dan perusahaan terus menekankan dua hal: komputasi milik sendiri dan pelatihan berbasis Eropa — menunjukkan fokus pemasarannya pada pengadaan oleh pemerintah Eropa dan industri yang diatur ketat.
Mistral belum mengumumkan syarat lisensi bobot open source maupun tanggal rilis pastinya. Semua skor yang ada saat ini juga baru berasal dari data perusahaan sendiri dan segelintir lembaga benchmark; seberapa banyak yang bisa direplikasi komunitas setelah mendapatkan bobotnya baru akan terlihat pada akhir bulan ini.
Sumber: blog resmi Mistral, Artificial Analysis, CocoLoop, CNBC, blog Simon Willison; skor Intelligence Index dan biaya per tugas berdasarkan data yang dipublikasikan Artificial Analysis, harga API berdasarkan harga pratinjau Mistral, dan kebutuhan VRAM merupakan estimasi kasar berdasarkan jumlah parameter.