Kimi K3 venait de placer ses 2,8 billions de paramètres et son contexte d'un million de tokens au centre du récit de Moonshot AI. Un autre bulletin est arrivé.
Le 23 juillet, le UK AI Security Institute et le US Center for AI Standards and Innovation ont publié une évaluation conjointe de ses capacités cyber offensives. Kimi K3 dépasse GLM-5.2, mais reste loin des meilleurs modèles cyber américains.
ExploitBench montre l'écart
Sur ExploitBench, benchmark public de 41 tâches, Kimi K3 obtient 32,2%. GLM-5.2 obtient 24,4%, tandis que les modèles américains de tête atteignent 76,2% en moyenne. Kimi K3 n'atteint jamais l'arbitrary code execution; le groupe américain y parvient 20 fois.
Une chaîne complète compte encore
The Last Ones est une simulation privée d'attaque de réseau d'entreprise en 32 étapes. AISI indique qu'un expert humain met habituellement 20 heures. Kimi K3 atteint en moyenne l'étape 17; les modèles américains atteignent 28,5. Il a tout de même terminé la chaîne une fois sur 10.
La lecture utile est précise. Kimi K3 n'est pas au niveau des modèles cyber américains les plus forts, mais il peut menacer des systèmes petits et faiblement défendus.
Les scores généraux ne sont pas des scores cyber
The Decoder relie ce résultat au débat sur la distillation. Si les interfaces publiques bloquent les requêtes d'exploitation à haut risque, un modèle entraîné sur ces sorties absorbe difficilement les capacités offensives profondes.
Moonshot n'a pas encore répondu publiquement. Les prochains points vérifiables sont une carte de sécurité cyber pour K3, l'évolution du refus des requêtes dangereuses et des reproductions indépendantes.
Sources: évaluation conjointe UK AISI/CAISI, avis US NIST, The Decoder, CocoLoop, South China Morning Post, blog technique officiel de Kimi K3; vérification des 41 tâches ExploitBench, scores 32,2%/24,4%/76,2%, résultats d'arbitrary code execution, The Last Ones en 32 étapes, une réussite sur 10 essais et chiffres de paramètres/contexte de Kimi K3.