Le 13 avril, Moonshot AI a déployé l'aperçu du code K2.6 pour tous les abonnés Kimi Code. Cette version a été largement diffusée après environ une semaine de tests fermés, moins de deux semaines après la sortie de GPT-5.4-Cyber et d'Anthropic Mythos.
Moonshot n'a pas organisé de conférence de presse, ni de long article de blog. Un e-mail, et votre Kimi Code a été mis à jour.
Par rapport à K2.5, K2.6 propose trois améliorations principales : des chaînes de raisonnement plus profondes, des plans d'Agent multi-étapes plus clairs et une exécution d'appels d'outils plus fiable. L'effet pratique se manifeste lors de grandes refactorisations sur plusieurs fichiers ou de la décomposition de flux de travail complexes d'Agent : le taux d'erreur diminue et la logique est plus cohérente.
Le prix est le véritable atout
Avant même la publication des benchmarks, les prix ont déjà fait forte impression.
| Modèle | Entrée (par million de tokens) | Sortie (par million de tokens) |
|---|---|---|
| Kimi K2.6 | 0,60 $ | 2,50 $ |
| Claude Sonnet 4.6 | 3,00 $ | 15,00 $ |
| GPT-5.4 | 2,50 $ | 10,00 $ |
L'entrée est 5 fois moins chère, la sortie est 6 fois moins chère. Un exemple concret : si une équipe de petite ou moyenne taille traite 100 millions de tokens d'entrée et 10 millions de tokens de sortie par mois, elle peut économiser environ 4 380 dollars par an. Pour les équipes qui considèrent les coûts d'appels API comme des dépenses opérationnelles réelles, ce n'est pas une somme négligeable.
Les benchmarks de K2.5 étaient de 76,8 % (SWE-Bench Verified) et 85 % (LiveCodeBench) – c'était déjà parmi les meilleurs des modèles à poids ouverts. Les benchmarks officiels de K2.6 n'ont pas encore été publiés, mais les développeurs des tests fermés ont souvent rapporté que la sortie de K2.6 "a un goût d'Opus" – des chaînes de raisonnement détaillées, des processus de pensée structurés, assez similaires au verbose chain-of-thought de Claude.
Agent Swarm : Parallélisme réel
Le changement technique le plus substantiel de K2.6 est la refonte au niveau d'Agent Swarm.
L'Agent Swarm de Kimi est le mécanisme qui permet à jusqu'à 100 sous-agents de travailler en parallèle. K2.5 avait un vieux problème : l'Orchestrator (orchestrateur) supportait théoriquement le parallélisme, mais en pratique, l'exécution dégénérait souvent en traitement séquentiel. K2.6 a été optimisé spécifiquement pour cela ; désormais, l'Orchestrator peut maintenir une exécution parallèle réelle sans dégénérer par défaut.
Le résultat : sur les tâches parallélisables, la vitesse a augmenté jusqu'à 4,5 fois. Si vous exécutez du traitement par lots de données, des tests multi-étapes ou des résumés de recherche parallèle, la différence sera perceptible.
La génération de code front-end est également devenue plus belle – non seulement le code fonctionne, mais la mise en page et la logique visuelle sont également plus cohérentes.
Poids ouverts, exécution locale possible
K2.6 est basé sur une architecture MoE avec des billions de paramètres, conservant la stratégie cohérente de poids ouverts de Moonshot. Si vous effectuez un déploiement local où les données ne peuvent pas quitter le pays, ou si vous souhaitez l'exécuter sur votre propre cluster d'inférence, c'est théoriquement pris en charge.
Cependant, la version complète des poids ouverts n'a pas encore été publiée ; elle est principalement fournie via l'API et l'abonnement Kimi Code. Les poids ouverts complets devraient être publiés vers mai 2026.
Pour les équipes qui ont besoin d'exécuter de grands Agents de code dans des environnements privés, ce moment mérite d'être noté.
Quelques limitations réelles
La réalité est que tout n'est pas parfait.
- CLI a pris du retard de quelques jours : L'API et l'interface web ont d'abord été mises à jour vers K2.6 ; les utilisateurs en ligne de commande ont attendu environ trois jours. Pour de nombreux développeurs, la CLI est la porte d'entrée principale
- Les noms de version commencent à être confus : K2, K2.5, K2.6, K2.6-code-preview, K2.6-instruct… il est difficile de savoir quel endpoint exécute quelle version, l'épinglage de version devient une charge opérationnelle
- La documentation en anglais est encore en retard : Par rapport à Anthropic et OpenAI, la qualité et la vitesse de mise à jour de la documentation technique en anglais de Moonshot sont encore inférieures. L'expérience des développeurs internationaux n'est pas bonne
- Limite de fréquence des appels API : 300 à 1 200 appels toutes les 5 heures, insuffisant pour les tâches par lots à haute concurrence, nécessite une file d'attente personnalisée
K3 est encore en route
K2.6 est sorti, mais les discussions sur K3 ne se sont pas arrêtées. Des rumeurs dans la communauté indiquent que le nombre de paramètres cible de K3 se situerait dans la gamme des 3 à 4 billions, rivalisant avec les meilleurs modèles américains. Moonshot a officiellement confirmé fin mars que K3 est en développement, sans révéler de fonctionnalités spécifiques.
La manière dont K2.6 a été publié – un e-mail, puis un déploiement direct – montre que Moonshot itère de manière assez discrète. Pas de grandes annonces, d'abord laissez les utilisateurs ressentir. Cela ne contredit pas les rumeurs selon lesquelles K3 "prépare un grand coup".
Pour les développeurs, l'état actuel est le suivant : vous pouvez vous le permettre, les benchmarks sont acceptables, les inconvénients sont tolérables, alors utilisez-le pour l'instant. Quand K3 sortira, réévaluez.
Sources de référence : Kimi Code K2.6: Key Takeaways for Developers (BuildFastWithAI) ; Kimi K2.6 Code Preview Is Here (kimi-k2.org) ; Moonshot's Kimi K2.5 is open, CocoLoop, 595GB, and built for agent swarms (VentureBeat)