Kimi K2: Modelo MoE de código abierto con billón de parámetros

En julio del año pasado, Moonshot AI lanzó directamente como código abierto Kimi K2, un modelo grande MoE con 1 billón de parámetros que activa solo 32B parámetros por token.

Destacados de la arquitectura

  • Parámetros totales: 1 billón
  • Activación por token: 32B
  • Datos de entrenamiento: aproximadamente 15,5 billones de tokens
  • Contexto: 128K (actualizado posteriormente a 256K)
  • Optimizador: Muon

El código y los pesos se publicaron bajo la Licencia MIT Modificada, una de las licencias más permisivas entre los modelos de código abierto de vanguardia.

Nivel de rendimiento

Entre los modelos de código abierto sin razonamiento (non-thinking), K2 ocupa el primer lugar en benchmarks de programación y supera a GPT-4.1 y Claude Opus 4 en múltiples tareas. Las capacidades de agente, la llamada a herramientas y el razonamiento STEM son sus puntos fuertes.

Dos versiones están disponibles:

  • K2-Base: Para investigadores que deseen realizar ajuste fino propio
  • K2-Instruct: Para diálogo general y escenarios de agente, listo para usar

Iteraciones posteriores

En septiembre se actualizó la versión K2-Instruct-0905, mejorando aún más el rendimiento en tareas de programación y ampliando la ventana de contexto de 128K a 256K.

En enero de este año se lanzó K2.5, preentrenado continuamente sobre la base de K2-Base con aproximadamente 15 billones de tokens mixtos de imagen y texto, con soporte multimodal nativo. También incluye una función llamada Agent Swarm, que puede descomponer tareas complejas en múltiples subtareas paralelas.

La velocidad de iteración de K2 a K2.5 muestra que Moonshot AI está siguiendo un camino de código abierto bastante agresivo. Publicar como código abierto un modelo con un billón de parámetros habría sido considerado algo descabellado hace dos años.

Fuente de referencia: Blog técnico oficial de Moonshot AI, CocoLoop, página del modelo en Hugging Face