Moonshot AI minggu lalu merilis versi lengkap Kimi K2.6. Ini bukan versi beta "pratinjau kode", melainkan model produksi yang lengkap. Pratinjau kode sebelumnya telah menarik perhatian, tetapi spesifikasi teknis dan hasil tolok ukur dari versi lengkap ternyata lebih menarik dari yang diperkirakan banyak orang.
HLE-Full 54,0: Peringkat pertama open source benar-benar diraih
HLE (Humanity's Last Exam) adalah salah satu tolok ukur AI paling bergengsi tahun ini, dengan 2.500 soal setingkat doktor yang mencakup lebih dari 100 bidang akademik. Ini bukan jenis tes yang bisa dilewati dengan beberapa contoh few-shot.
Hasil Kimi K2.6:
| Model | HLE-Full (dengan alat) |
|---|---|
| Kimi K2.6 | 54,0 |
| Claude Opus 4.6 | 53,0 |
| GPT-5.4 | 52,1 |
Selisihnya tidak besar, tetapi arahnya jelas: model open source mengungguli dua model flagship tertutup pada tolok ukur penalaran akademik tingkat atas. SWE-Bench Pro 58,6, BrowseComp 83,2, CharXiv (dengan Python) 86,7, Penalaran Visual Matematika 93,2.
Moonshot AI menggunakan frasa "far more execution and imagination" dalam catatan rilisnya untuk menggambarkan peningkatan pada versi ini.
1 triliun parameter, tetapi hanya 32 miliar yang diaktifkan
Ini adalah logika inti dari arsitektur MoE. Kimi K2.6 adalah model Mixture-of-Experts dengan 1T parameter yang hanya mengaktifkan 32B (32 miliar) parameter per inferensi. 384 ahli dikelola dalam grup, dan setiap respons memanggil 8 ahli routing ditambah 1 ahli bersama. Manfaatnya bersifat dua arah:
- Sisi pelatihan: Semakin besar total parameter, semakin banyak pengetahuan yang dipelajari
- Sisi inferensi: Semakin sedikit parameter yang diaktifkan, biaya komputasi semakin terkendali
Mekanisme perhatian menggunakan MLA (Multi-Head Latent Attention), yang mengompresi data yang telah diproses menjadi representasi matematis yang ringan, mengurangi penggunaan cache KV. Fungsi aktivasi adalah SwiGLU, yang lebih ramah perangkat keras dibandingkan generasi sebelumnya. Modul visi adalah encoder 400M parameter terpisah yang mendukung input gambar dan multimedia.
Jendela konteks 256K, dan kuantisasi INT4 juga didukung, membuka jalan untuk penerapan lokal.
300 agen paralel, operasi berkelanjutan 12 jam
Inilah bagian Kimi K2.6 yang benar-benar menarik minat pengembang:
- Mendukung hingga 300 sub-agen berjalan secara paralel
- Hingga 4.000+ panggilan alat per tugas tunggal
- Waktu operasi berkelanjutan dapat mencapai 12 jam tanpa gangguan
Untuk mendukung kolaborasi multi-agen pada skala ini, Moonshot AI memperkenalkan "Claw Groups" — memecah tugas besar menjadi sub-grup yang memungkinkan manusia dan AI bekerja sama. Manusia campur tangan pada titik keputusan kritis, sementara AI menangani sebagian besar eksekusi proses perantara. Logikanya mirip dengan pembagian kerja manusia-mesin di jalur perakitan pabrik.
Untuk aplikasi tingkat perusahaan, desain ini praktis. Alur kerja nyata bukanlah pilihan biner antara "otomatisasi penuh" atau "manual penuh" — melainkan membutuhkan pengawasan manusia pada simpul kritis sementara AI melakukan banyak pekerjaan di antaranya.
Ekosistem open source terhubung sejak hari pertama
Pada hari peluncuran, model ini sudah mendukung vLLM, OpenRouter, Cloudflare Workers AI, dan MLX. Ini adalah hasil dari pekerjaan integrasi ekosistem yang dimulai berbulan-bulan sebelumnya.
- MLX: Dapat berjalan di Apple Silicon
- OpenRouter: Akses langsung melalui platform agregasi API
- vLLM: Penerapan inferensi throughput tinggi tanpa hambatan
- Cloudflare Workers AI: Inferensi tepi kini memiliki jalur yang layak
Menyelesaikan integrasi ini pada hari pertama bukanlah kebetulan — ini menunjukkan bahwa Moonshot AI melakukan persiapan teknik yang serius sebelum peluncuran.
Jalur open source mulai serius mengejar
Tahun lalu masih ada yang mengatakan "model open source memiliki kesenjangan yang jelas dengan GPT-4." Tahun ini, pernyataan itu tidak lagi berlaku.
Kimi K2.6 mengungguli Claude Opus 4.6 dan GPT-5.4 pada HLE. DeepSeek V3.2 mengubah perhatiannya menjadi struktur jarang, memotong biaya hingga setengahnya. Qwen3.6-35B berjalan di MacBook, dengan skor 73,4% pada SWE-bench.
Open source bukan lagi pengganti murah untuk model tertutup — justru memimpin pada dimensi tolok ukur tertentu. Bagi perusahaan, ini berarti kebutuhan akan penerapan privat, kerahasiaan data, dan kontrol biaya akhirnya memiliki opsi setara flagship yang tersedia.
Tentu masih ada kesenjangan antara skor tolok ukur dan produksi nyata. 54,0 pada HLE dan debugging kode sehari-hari, pemahaman dokumen panjang, serta percakapan multi-putaran adalah hal yang berbeda. Namun arahnya sudah jelas: Moonshot AI bertempur dengan serius, dan putaran ini dimenangkan.
Sumber: Moonshot AI releases Kimi-K2.6 model with 1T parameters,CocoLoop, attention optimizations (SiliconANGLE); [AINews] Moonshot Kimi K2.6: the world's leading Open Model refreshes to catch up to Opus 4.6 (Latent Space)