Thinking Machines a lancé Inkling-Small le 30 juillet. Le modèle compte 276B paramètres au total et 12B actifs, accepte texte, image et audio, et arrive avec des poids ouverts.
Selon l'annonce officielle, il a été entraîné après Inkling, avec un mélange de données et une recette de formation améliorés. Il a aussi utilisé une on-policy distillation avec Inkling comme enseignant, puis deux semaines de RL pour l'agentic coding.
“Inkling-Small’s combination of broad performance and efficiency will make it easy to experiment with and test in real applications.”
Plus petit, mais toujours lourd
La model card décrit un Transformer decoder-only de 42 couches avec MoE clairsemé: chaque token va vers 6 des 256 experts, plus 2 experts partagés. Le contexte atteint 1 million de tokens et la licence est Apache 2.0.
vLLM Recipes indique au moins 180GB de VRAM agrégée pour NVFP4 et 600GB pour BF16. Ce n'est pas un modèle de laptop, mais le seuil est plus bas que l'empreinte multi-téraoctet de l'Inkling initial citée par 36Kr/Xinzhiyuan.
Des scores forts, pas une victoire totale
Dans la table officielle, Inkling-Small obtient 80,2% sur SWE-bench Verified, 64,7% sur Terminal Bench 2.1, 31,6% sur HLE text only et 40,1% sur ARC-AGI-2. Ces valeurs dépassent Inkling dans la même table.
Artificial Analysis propose une lecture plus prudente: 40 sur l'Intelligence Index, un point sous Inkling à 41, avec des faiblesses restantes en connaissance factuelle et dans certaines tâches agentiques.
La suite dépend des utilisateurs
Thinking Machines fournit les poids, la model card, Hugging Face et des chemins vLLM/SGLang. Les prochaines vérifications seront la stabilité sur des configurations 180GB/600GB, le fine-tuning sur des bases de code réelles et la reproduction des gains de code et multimodalité hors des harnesses officiels.
Sources: 36Kr/Xinzhiyuan, annonce Thinking Machines, CocoLoop, model card Inkling-Small, Artificial Analysis, Hugging Face et vLLM Recipes; les sources officielles vérifient jalon de lancement, paramètres, licence, contexte, entraînement et benchmarks, tandis que les tiers vérifient les seuils de déploiement et les scores indépendants.