Kimi K1.5、強化学習による推論を実証

Moonshot AIがK2の前にリリースしたK1.5の核心は、純粋な強化学習で推論能力を高めることにある。

技術的アプローチ

K1.5の推論強化は、SFT(教師ありファインチューニング)やRLHFといった従来の手法に頼らず、純粋なRL(強化学習)トレーニングに大きく依存している。

これはDeepSeek R1のアプローチと似ている。すなわち、人間がラベル付けした「正しい推論ステップ」で教えるのではなく、モデルが大量の試行錯誤と報酬シグナルを通じて自ら推論を学習するという方法だ。

利点は以下の通り:

  • 人間がラベル付けしたデータの質や量に制限されない
  • モデルが人間のアノテーターが思いつかなかった推論戦略を学習できる可能性がある
  • 理論的にスケールアップが容易

パフォーマンス

K1.5は数学的推論ベンチマークにおいて、同世代のオープンソースモデルの中でトップクラスの成績を達成した。GPT-4oやClaude Opusといったクローズドソースモデルとの差はまだあるものの、その差は許容範囲内である。

さらに重要なのは、K1.5が中規模モデルにおける純粋RLアプローチの実現可能性を実証したことだ。これにより、その後のK2およびK2.5の開発に向けた技術的基盤が築かれた。

K2との関係

K1.5はK2の技術プレビュー版のような位置づけだ。RL駆動の推論という技術的アプローチを実証した後、K2はこの方法論をそのまま兆パラメータ規模に適用し、さらに計算コストを抑えるためにMoEアーキテクチャを採用した。

K1.5からK2への反復プロセスは、Moonshot AIの研究開発戦略が方法論をまず実証してからスケールアップするというものであり、最初から巨大なパラメータ数に賭けるわけではないことを示している。この段階的アプローチは、リソースが限られたチームにとって現実的である。

参考元:CocoLoop、Moonshot AI技術ブログ