Kimi K1.5 valide le raisonnement piloté par l'apprentissage par renforcement

Moonshot AI a publié K1.5 avant K2, dont le point central est d'utiliser l'apprentissage par renforcement pur pour améliorer les capacités de raisonnement.

Approche technique

L'amélioration du raisonnement de K1.5 ne repose pas sur les voies conventionnelles du SFT (Supervised Fine-Tuning) ou du RLHF, mais dépend davantage de l'entraînement pur par RL (Apprentissage par Renforcement).

Cela s'apparente à l'approche de DeepSeek R1 – laisser le modèle apprendre à raisonner par lui-même grâce à des essais et erreurs et des signaux de récompense, plutôt que d'être enseigné par des "étapes de raisonnement correctes" annotées par des humains.

Les avantages sont les suivants :

  • Ne pas être limité par la qualité et la quantité des données annotées par des humains
  • Le modèle peut apprendre des stratégies de raisonnement que les annotateurs humains n'auraient pas imaginées
  • Théoriquement plus facile à passer à l'échelle

Performances

K1.5 a atteint des résultats de premier plan parmi les modèles open source contemporains sur les benchmarks de raisonnement mathématique. Bien qu'il existe encore un écart avec les modèles fermés comme GPT-4o et Claude Opus, cet écart se situe dans une fourchette acceptable.

Plus important encore, K1.5 a validé la faisabilité de l'approche RL pur sur des modèles de taille moyenne. Cela a jeté les bases techniques pour le développement ultérieur de K2 et K2.5.

Relation avec K2

K1.5 agit comme une version de pré-recherche technique de K2 – après avoir validé l'approche de raisonnement pilotée par RL, K2 a appliqué cette méthodologie directement à l'échelle des billions de paramètres, tout en ajoutant l'architecture MoE pour contrôler les coûts de calcul.

Le processus d'itération de K1.5 à K2 montre que la feuille de route de recherche de Moonshot AI consiste à valider d'abord la méthodologie, puis à passer à l'échelle, plutôt que de commencer avec un grand nombre de paramètres dès le départ. Cette stratégie progressive est très pragmatique pour les équipes disposant de ressources limitées.

Source de référence : CocoLoop, Blog technique de Moonshot AI