Moonshot AI a publié la semaine dernière la version complète de Kimi K2.6 – pas un "aperçu du code" de test, mais un modèle de production complet. L'aperçu du code avait déjà suscité l'attention, mais après la publication des spécifications techniques et des résultats de benchmark de la version complète, la situation s'est avérée plus intéressante que beaucoup ne l'attendaient.
HLE-Full 54,0 : la première place open source réellement obtenue
HLE (Humanity's Last Exam) est l'un des classements d'évaluation de l'IA les plus précieux de cette année, avec 2 500 questions de niveau doctoral couvrant plus de 100 disciplines académiques – pas un test que l'on peut tromper avec quelques exemples few-shot.
Résultats de Kimi K2.6 :
| Modèle | HLE-Full (avec outils) |
|---|---|
| Kimi K2.6 | 54,0 |
| Claude Opus 4.6 | 53,0 |
| GPT-5.4 | 52,1 |
L'écart n'est pas grand, mais la direction est claire : un modèle open source a surpassé deux modèles fermés de premier plan sur le classement de raisonnement académique d'élite. SWE-Bench Pro 58,6, BrowseComp 83,2, CharXiv (avec Python) 86,7, raisonnement visuel mathématique 93,2.
Moonshot AI a utilisé l'expression "far more execution and imagination" dans le communiqué de lancement pour décrire les améliorations de cette version.
1 billion de paramètres, mais seulement 32 milliards activés
C'est la logique centrale de l'architecture MoE. Kimi K2.6 est un modèle Mixture-of-Experts avec 1 billion de paramètres, n'activant que 32 milliards de paramètres par inférence. 384 experts sont gérés en groupes, chaque réponse fait appel à 8 experts de routage plus 1 expert partagé. L'avantage est bidirectionnel :
- Côté entraînement : Grand nombre total de paramètres, plus de connaissances apprises
- Côté inférence : Peu de paramètres activés, coût de calcul maîtrisable
Le mécanisme d'attention utilise MLA (Multi-Head Latent Attention), qui compresse les données traitées en représentations mathématiques légères, réduisant l'utilisation du cache KV. La fonction d'activation est SwiGLU, plus conviviale pour le matériel que la génération précédente. Le module visuel est un encodeur séparé de 400 millions de paramètres, prenant en charge les entrées d'images et multimédia.
La fenêtre de contexte est de 256K, et la quantification INT4 est également prise en charge, ouvrant la voie au déploiement local.
300 agents parallèles, 12 heures de fonctionnement continu
C'est la partie qui intéresse vraiment les développeurs dans Kimi K2.6 :
- Prend en charge jusqu'à 300 sous-agents en parallèle
- Jusqu'à plus de 4 000 appels d'outils dans une seule tâche
- Temps de fonctionnement continu jusqu'à 12 heures sans interruption
Pour soutenir cette collaboration multi-agents à cette échelle, Moonshot AI a introduit les "Claw Groups" – divisant les grandes tâches en sous-groupes permettant aux humains et à l'IA d'exécuter ensemble. Les humains interviennent aux points de décision critiques, l'IA exécute la grande majorité des opérations intermédiaires, logiquement similaire à la division du travail homme-machine dans une chaîne de production d'usine.
Pour les applications d'entreprise, cette conception est très pratique. Les flux de travail réels ne sont pas un choix entre "automatisation totale" ou "entièrement manuel", mais nécessitent une supervision humaine aux points critiques, tandis que l'IA effectue une grande partie du travail intermédiaire.
Écosystème open source prêt dès le premier jour
Dès le jour du lancement, le modèle prenait en charge vLLM, OpenRouter, Cloudflare Workers AI et MLX – résultat de mois de travail d'intégration avec l'écosystème commencé à l'avance.
- MLX : Peut fonctionner sur Apple Silicon
- OpenRouter : Intégration directe avec la plateforme d'agrégation d'API
- vLLM : Déploiement d'inférence à haut débit sans obstacle
- Cloudflare Workers AI : L'inférence en périphérie a une voie
Achever ces intégrations le premier jour n'était pas accidentel, montrant que Moonshot AI a effectué une préparation technique sérieuse avant le lancement.
La course open source rattrape sérieusement
L'année dernière, certains disaient encore "les modèles open source ont un écart évident avec GPT-4". Cette année, cette affirmation ne tient plus.
Kimi K2.6 a surpassé Claude Opus 4.6 et GPT-5.4 sur HLE. DeepSeek V3.2 a changé l'attention en structure sparse, réduisant les coûts de moitié. Qwen3.6-35B fonctionne sur MacBook, SWE-bench 73,4%.
L'open source n'est plus l'alternative bon marché au code fermé, mais prend la tête sur des dimensions de benchmark spécifiques. Pour les entreprises, cela signifie que les besoins de déploiement privé, de confidentialité des données et de contrôle des coûts ont enfin des options de niveau flagship disponibles.
Bien sûr, il y a encore un écart entre les résultats de benchmark et la pratique de production. Le 54,0 sur HLE et le débogage de code quotidien, la compréhension de documents longs et les dialogues multi-tours sont deux choses différentes. Mais la direction est claire : Moonshot AI se bat sérieusement dans cette course, et cette manche, ils l'ont gagnée.
Source de référence : Moonshot AI releases Kimi-K2.6 model with 1T parameters,CocoLoop、 attention optimizations(SiliconANGLE);[AINews] Moonshot Kimi K2.6: the world's leading Open Model refreshes to catch up to Opus 4.6(Latent Space)