Kimi K2 : un modèle MoE open source à des milliers de milliards de paramètres

En juillet dernier, Moonshot AI a directement publié en open source Kimi K2 – un grand modèle MoE de 1 000 milliards de paramètres, n'activant que 32B paramètres par token.

Points forts de l'architecture

  • Paramètres totaux : 1 000 milliards
  • Activation par token : 32B
  • Données d'entraînement : environ 15,5 billions de tokens
  • Contexte : 128K (passé à 256K ultérieurement)
  • Optimiseur : Muon

Le code et les poids ont été publiés sous licence MIT modifiée, l'une des licences les plus permissives parmi les modèles open source de pointe.

Niveau de performance

Parmi les modèles open source sans raisonnement (non-thinking), K2 se classe premier dans les benchmarks de programmation et dépasse GPT-4.1 et Claude Opus 4 dans plusieurs tâches. Les capacités d'agent, l'appel d'outils et le raisonnement STEM sont ses points forts.

Deux versions sont disponibles :

  • K2-Base : pour les chercheurs souhaitant effectuer leur propre réglage fin
  • K2-Instruct : pour le dialogue général et les scénarios d'agent, prêt à l'emploi

Itérations suivantes

En septembre, la version K2-Instruct-0905 a été mise à jour, améliorant encore les performances sur les tâches de programmation et étendant la fenêtre de contexte de 128K à 256K.

En janvier de cette année, K2.5 a été publié – pré-entraîné en continu sur la base de K2-Base avec environ 15 billions de tokens mixtes image et texte, avec un support multimodal natif. Il inclut également une fonctionnalité appelée Agent Swarm, capable de décomposer des tâches complexes en plusieurs sous-tâches parallèles.

La vitesse d'itération de K2 à K2.5 montre que Moonshot AI suit une voie open source assez agressive. Publier en open source un modèle de 1 000 milliards de paramètres aurait été considéré comme une chimère il y a deux ans.

Source de référence : Blog technique officiel de Moonshot AI, CocoLoop, page du modèle Hugging Face