Moonshot AI lanzó la semana pasada la versión completa de Kimi K2.6 – no una "vista previa de código" de prueba, sino un modelo de producción completo. La vista previa de código ya había generado atención, pero tras la publicación de las especificaciones técnicas y los resultados de benchmark de la versión completa, la situación resultó ser más interesante de lo que muchos esperaban.
HLE-Full 54,0: primer puesto open source realmente conseguido
HLE (Humanity's Last Exam) es uno de los rankings de evaluación de IA más valiosos de este año, con 2.500 preguntas a nivel de doctorado que abarcan más de 100 disciplinas académicas – no es algo que se pueda engañar con unos pocos ejemplos few-shot.
Resultados de Kimi K2.6:
| Modelo | HLE-Full (con herramientas) |
|---|---|
| Kimi K2.6 | 54,0 |
| Claude Opus 4.6 | 53,0 |
| GPT-5.4 | 52,1 |
La diferencia no es grande, pero la dirección es clara: un modelo open source ha superado a dos modelos cerrados de primer nivel en el ranking de razonamiento académico de élite. SWE-Bench Pro 58,6, BrowseComp 83,2, CharXiv (con Python) 86,7, razonamiento visual matemático 93,2.
Moonshot AI utilizó la expresión "far more execution and imagination" en el comunicado de lanzamiento para describir las mejoras de esta versión.
1 billón de parámetros, pero solo se activan 32 mil millones
Esta es la lógica central de la arquitectura MoE. Kimi K2.6 es un modelo Mixture-of-Experts con 1 billón de parámetros, que activa solo 32 mil millones de parámetros por inferencia. 384 expertos se gestionan en grupos, cada respuesta convoca a 8 expertos de enrutamiento más 1 experto compartido. El beneficio es bidireccional:
- Lado del entrenamiento: Gran número total de parámetros, se aprende más conocimiento
- Lado de la inferencia: Pocos parámetros activados, costo computacional controlable
El mecanismo de atención utiliza MLA (Multi-Head Latent Attention), que comprime los datos procesados en representaciones matemáticas ligeras, reduciendo el uso de caché KV. La función de activación es SwiGLU, más amigable con el hardware que la generación anterior. El módulo visual es un codificador separado de 400 millones de parámetros, que soporta entrada de imágenes y multimedia.
La ventana de contexto es de 256K, y también soporta cuantización INT4, allanando el camino para la implementación local.
300 agentes paralelos, 12 horas de operación continua
Esta es la parte que realmente interesa a los desarrolladores de Kimi K2.6:
- Soporta hasta 300 subagentes en paralelo
- Hasta más de 4.000 llamadas a herramientas en una sola tarea
- Tiempo de operación continua de hasta 12 horas sin interrupción
Para soportar esta colaboración multiagente a escala, Moonshot AI introdujo "Claw Groups" – dividiendo tareas grandes en subgrupos que permiten la ejecución conjunta de humanos e IA. Los humanos intervienen en puntos de decisión críticos, la IA ejecuta la mayor parte de las operaciones intermedias, lógicamente similar a la división de trabajo humano-máquina en una línea de producción fabril.
Para aplicaciones empresariales, este diseño es muy práctico. Los flujos de trabajo reales no son una elección entre "automatización total" o "completamente manual", sino que requieren supervisión humana en puntos críticos, mientras la IA realiza gran parte del trabajo intermedio.
Ecosistema open source listo desde el primer día
El mismo día del lanzamiento, el modelo ya soportaba vLLM, OpenRouter, Cloudflare Workers AI y MLX – resultado de meses de trabajo de integración con el ecosistema iniciado con antelación.
- MLX: Puede ejecutarse en Apple Silicon
- OpenRouter: Integración directa con la plataforma de agregación de API
- vLLM: Implementación de inferencia de alto rendimiento sin obstáculos
- Cloudflare Workers AI: Inferencia en el borde tiene un camino
Completar estas integraciones el primer día no fue accidental, mostrando que Moonshot AI realizó una preparación técnica seria antes del lanzamiento.
La carrera open source está siguiendo seriamente
El año pasado, todavía había quien decía "los modelos open source tienen una brecha clara con GPT-4". Este año, esa afirmación ya no se sostiene.
Kimi K2.6 ha superado a Claude Opus 4.6 y GPT-5.4 en HLE. DeepSeek V3.2 cambió la atención a estructura dispersa, reduciendo los costos a la mitad. Qwen3.6-35B se ejecuta en MacBook, SWE-bench 73,4%.
Open source ya no es una alternativa económica al código cerrado, sino que está liderando en dimensiones específicas de benchmark. Para las empresas, esto significa que necesidades como implementación privada, confidencialidad de datos y control de costos finalmente tienen opciones de nivel flagship disponibles.
Por supuesto, todavía hay distancia entre los resultados de benchmark y la práctica de producción. El 54,0 en HLE y la depuración de código cotidiana, la comprensión de documentos largos y los diálogos de múltiples rondas son cosas diferentes. Pero la dirección ya está clara: Moonshot AI está luchando seriamente en esta batalla, y esta ronda la han ganado.
Fuente de referencia: Moonshot AI releases Kimi-K2.6 model with 1T parameters,CocoLoop、 attention optimizations(SiliconANGLE);[AINews] Moonshot Kimi K2.6: the world's leading Open Model refreshes to catch up to Opus 4.6(Latent Space)