Thinking Machines lanzó Inkling-Small el 30 de julio. El modelo tiene 276B parámetros totales y 12B activos, acepta texto, imagen y audio, y llega con pesos abiertos.
La compañía dice que se entrenó después de Inkling, con una mezcla de datos y una receta de entrenamiento mejoradas. También usó on-policy distillation con Inkling como profesor y dos semanas adicionales de RL para agentic coding.
“Inkling-Small’s combination of broad performance and efficiency will make it easy to experiment with and test in real applications.”
Más pequeño, pero no ligero
La model card describe un Transformer decoder-only de 42 capas con MoE disperso: cada token se enruta a 6 de 256 expertos, más 2 expertos compartidos. La ventana de contexto llega a 1 millón de tokens y la licencia es Apache 2.0.
vLLM Recipes sitúa la variante NVFP4 en al menos 180GB de VRAM agregada, y BF16 en 600GB. No es una configuración doméstica, pero baja el listón frente al Inkling original de escala multi-terabyte citado por 36Kr/Xinzhiyuan.
Buenos resultados, con límites
En la tabla oficial, Inkling-Small obtiene 80.2% en SWE-bench Verified, 64.7% en Terminal Bench 2.1, 31.6% en HLE text only y 40.1% en ARC-AGI-2. En todos esos puntos supera al Inkling grande.
Artificial Analysis lo coloca con más cautela: 40 puntos en Intelligence Index, solo uno por debajo de Inkling con 41, aunque con debilidades en conocimiento factual y algunas tareas agentic.
La prueba sale del laboratorio
Thinking Machines no publicó solo un archivo de pesos. También entregó model card, Hugging Face y rutas de despliegue mediante vLLM y SGLang. La siguiente verificación es si los equipos pueden operarlo de forma estable en 180GB/600GB, ajustarlo a sus propios repositorios y reproducir sus ventajas de código y multimodalidad fuera de los harnesses oficiales.
Fuentes: 36Kr/Xinzhiyuan, anuncio de Thinking Machines, CocoLoop, model card de Inkling-Small, Artificial Analysis, Hugging Face y vLLM Recipes; las fuentes oficiales verifican hito de lanzamiento, parámetros, licencia, contexto, entrenamiento y benchmarks, mientras que terceros verifican requisitos de despliegue y puntuaciones independientes.