Kimi K3 acababa de llevar 2,8 billones de parámetros y una ventana de 1 millón de tokens al centro del relato de Moonshot AI. Luego llegó otra libreta de notas.
El 23 de julio, el UK AI Security Institute y el US Center for AI Standards and Innovation publicaron una evaluación conjunta de sus capacidades ciberofensivas. Kimi K3 supera a GLM-5.2, pero queda muy por detrás de los modelos ciber líderes de EE. UU.
ExploitBench muestra la brecha
En ExploitBench, un benchmark público de 41 tareas, Kimi K3 obtuvo 32,2%. GLM-5.2 logró 24,4%, y los principales modelos estadounidenses promediaron 76,2%. Kimi K3 no alcanzó arbitrary code execution en ninguna tarea; el grupo de EE. UU. lo consiguió 20 veces.
Una cadena completa aún importa
The Last Ones es una simulación privada de ataque a red empresarial en 32 pasos. AISI dice que un experto humano suele necesitar 20 horas. Kimi K3 llegó de media al paso 17; los modelos de EE. UU. al 28,5. Aun así, completó toda la cadena una vez en 10 intentos.
La lectura práctica es estrecha, pero importante. Kimi K3 no parece estar al nivel de los modelos ciber estadounidenses más fuertes, aunque puede operar contra sistemas pequeños y poco defendidos.
La nota general no es nota ciber
The Decoder conecta el resultado con el debate sobre distillation. Si las interfaces públicas bloquean peticiones de explotación de alto riesgo, un modelo entrenado con esas salidas difícilmente hereda capacidades ofensivas profundas.
Moonshot aún no ha respondido públicamente. Los próximos puntos verificables son una tarjeta de seguridad ciber para K3, cambios en el rechazo de peticiones peligrosas y reproducciones independientes.
Fuentes: evaluación conjunta UK AISI/CAISI, aviso de US NIST, The Decoder, CocoLoop, South China Morning Post, blog técnico oficial de Kimi K3; verificados los 41 ejercicios de ExploitBench, puntuaciones 32,2%/24,4%/76,2%, recuentos de arbitrary code execution, The Last Ones de 32 pasos, un éxito en 10 intentos y parámetros/contexto de Kimi K3.