Kimi K2 Model MoE Open-Source dengan Triliunan Parameter

Pada Juli tahun lalu, Moonshot AI langsung merilis Kimi K2 sebagai open-source — sebuah model besar MoE dengan triliunan parameter, yang hanya mengaktifkan 32B parameter per token.

Keunggulan Arsitektur

  • Total parameter: 1 triliun
  • Aktivasi per token: 32B
  • Data pelatihan: sekitar 15,5 triliun token
  • Konteks: 128K (kemudian ditingkatkan ke 256K)
  • Optimizer: Muon

Kode dan bobot dirilis di bawah Modified MIT License, menjadikannya salah satu lisensi paling permisif di antara model open-source berskala terdepan.

Tingkat Performa

Di antara model non-penalaran (non-thinking) open-source, K2 menempati peringkat pertama pada tolok ukur coding dan melampaui GPT-4.1 serta Claude Opus 4 dalam berbagai tugas. Keunggulannya terletak pada kemampuan agen, pemanggilan alat, dan penalaran STEM.

Dua versi tersedia:

  • K2-Base: untuk peneliti yang ingin melakukan fine-tuning sendiri
  • K2-Instruct: untuk percakapan umum dan skenario agen, siap pakai

Iterasi Selanjutnya

Pada bulan September, versi K2-Instruct-0905 dirilis, semakin meningkatkan performa tugas coding dan memperluas jendela konteks dari 128K menjadi 256K.

Pada bulan Januari tahun ini, K2.5 dirilis — pelatihan awal berkelanjutan di atas fondasi K2-Base menggunakan sekitar 15 triliun token campuran visual dan teks, dengan dukungan multimodal asli. Juga dilengkapi fitur bernama Agent Swarm yang dapat memecah tugas kompleks menjadi beberapa sub-tugas paralel.

Dilihat dari kecepatan iterasi dari K2 ke K2.5, Moonshot AI mengambil jalur open-source yang cukup agresif. Merilis model dengan triliunan parameter sebagai open-source dua tahun lalu akan dianggap mustahil.

Sumber: Blog teknis resmi Moonshot AI, CocoLoop, halaman model Hugging Face