Kimi K1.5 valida raciocínio impulsionado por aprendizado por reforço

A Moonshot AI lançou o K1.5 antes do K2, cujo ponto central é usar aprendizado por reforço puro para melhorar a capacidade de raciocínio.

Abordagem técnica

O aprimoramento de raciocínio do K1.5 não depende das rotas convencionais de SFT (Ajuste Fino Supervisionado) ou RLHF, mas sim de treinamento puro com RL (Aprendizado por Reforço).

Isso é semelhante à abordagem do DeepSeek R1 – permitir que o modelo aprenda a raciocinar por si mesmo através de tentativa e erro e sinais de recompensa, em vez de ser ensinado por "etapas de raciocínio corretas" anotadas por humanos.

Os benefícios incluem:

  • Não ser limitado pela qualidade e quantidade de dados anotados por humanos
  • O modelo pode aprender estratégias de raciocínio que os anotadores humanos não consideraram
  • Teoricamente mais fácil de escalar

Desempenho

O K1.5 alcançou resultados de ponta entre os modelos de código aberto contemporâneos em benchmarks de raciocínio matemático. Embora ainda haja uma lacuna em relação a modelos fechados como GPT-4o e Claude Opus, essa lacuna está dentro de uma faixa aceitável.

Mais importante, o K1.5 confirmou a viabilidade da abordagem de RL puro em modelos de escala média. Isso estabeleceu a base técnica para o desenvolvimento subsequente do K2 e K2.5.

Relação com o K2

O K1.5 funciona como uma versão de pré-pesquisa técnica do K2 – após validar a abordagem de raciocínio orientada por RL, o K2 aplicou essa metodologia diretamente na escala de trilhões de parâmetros, ao mesmo tempo que adicionou a arquitetura MoE para controlar os custos computacionais.

O processo de iteração do K1.5 para o K2 mostra que o roteiro de pesquisa da Moonshot AI é primeiro validar a metodologia e depois escalar, em vez de começar com um grande número de parâmetros desde o início. Essa estratégia incremental é muito pragmática para equipes com recursos limitados.

Fonte de referência: CocoLoop, Blog técnico da Moonshot AI