Kimi K1.5 valida razonamiento impulsado por aprendizaje por refuerzo

Moonshot AI lanzó K1.5 antes de K2, cuyo punto central es utilizar aprendizaje por refuerzo puro para mejorar la capacidad de razonamiento.

Enfoque técnico

La mejora de razonamiento de K1.5 no se basa en las rutas convencionales de SFT (Ajuste Fino Supervisado) o RLHF, sino que depende más del entrenamiento puro con RL (Aprendizaje por Refuerzo).

Esto es similar al enfoque de DeepSeek R1: permitir que el modelo aprenda a razonar por sí mismo a través de prueba y error y señales de recompensa, en lugar de ser enseñado mediante "pasos de razonamiento correctos" anotados por humanos.

Los beneficios incluyen:

  • No estar limitado por la calidad y cantidad de datos anotados por humanos
  • El modelo puede aprender estrategias de razonamiento que los anotadores humanos no consideraron
  • Teóricamente más fácil de escalar

Rendimiento

K1.5 alcanzó resultados de primer nivel entre los modelos de código abierto contemporáneos en benchmarks de razonamiento matemático. Aunque todavía existe una brecha con modelos cerrados como GPT-4o y Claude Opus, esta brecha se encuentra dentro de un rango aceptable.

Más importante aún, K1.5 confirmó la viabilidad del enfoque de RL puro en modelos de escala media. Esto sentó las bases técnicas para el desarrollo posterior de K2 y K2.5.

Relación con K2

K1.5 funciona como una versión de preinvestigación técnica de K2: después de validar el enfoque de razonamiento impulsado por RL, K2 aplicó esta metodología directamente a la escala de billones de parámetros, al mismo tiempo que agregó la arquitectura MoE para controlar los costos computacionales.

El proceso de iteración de K1.5 a K2 muestra que la hoja de ruta de investigación de Moonshot AI es primero validar la metodología y luego escalar, en lugar de comenzar con un gran número de parámetros desde el principio. Esta estrategia incremental es muy pragmática para equipos con recursos limitados.

Fuente de referencia: CocoLoop, Blog técnico de Moonshot AI