Kimi K1.5 驗證強化學習驅動推理

月之暗面在 K2 之前發佈的 K1.5,核心看點是用純強化學習來提升推理能力

技術路線

K1.5 的推理增強不是靠 SFT(監督微調)或 RLHF 的常規路線,而是更加依賴純 RL(強化學習)訓練

這和 DeepSeek R1 的思路類似——讓模型透過大量的試錯和獎勵訊號自己學會推理,而不是靠人類標註的「正確推理步驟」來教。

好處是:

  • 不受限於人類標註資料的品質和數量
  • 模型可能學到人類標註者沒想到的推理策略
  • 理論上更容易 scale up

表現

K1.5 在數學推理 benchmark 上的成績達到了同期開源模型的前列水準。雖然和 GPT-4o、Claude Opus 這些閉源模型還有差距,但差距在可接受的範圍內

更重要的是,K1.5 驗證了純 RL 路線在中規模模型上的可行性。這為後續 K2 和 K2.5 的發展奠定了技術基礎。

和 K2 的關係

K1.5 像是 K2 的技術預研版本——驗證了 RL 驅動推理的技術路線之後,K2 直接在萬億參數規模上應用了這套方法論,同時加入了 MoE 架構來控制計算成本。

從 K1.5 到 K2 的疊代過程說明,月之暗面的研發路線是先驗證方法論再 scale up,而不是一開始就砸大參數量。這種漸進式策略對於資源有限的團隊來說很務實。

參考來源:CocoLoop、Moonshot AI 技術部落格