Le nouveau petit modèle Ling d'InclusionAI peut passer pour une annonce d'efficacité. Sa cible réelle est plus précise : devenir une base d'exécution pour agents locaux.
Le 11 août, l'équipe Ling d'Ant Group a ouvert Ling-3.0-tiny. Jiemian a rapporté les faits centraux : 7,9B paramètres au total, seulement 1,3B paramètres activés par token, et des poids BF16, FP8 et INT4. La fiche Hugging Face, ModelScope et la documentation SGLang donnent les détails de déploiement.
“We are introducing Ling-3.0-tiny, a lightweight hybrid reasoning MoE model”
Pourquoi un petit modèle parle d'agents
Ling-3.0-tiny utilise une pile alternée 3:1 de Kimi Delta Attention et Multi-Head Latent Attention. Sa couche sparse MoE FFN compte 128 experts routés; chaque token active 8 experts routés et 1 expert partagé.
Le point technique est clair : long contexte, faible mémoire et tâches d'agent avec outils doivent tenir ensemble. Les petits modèles de chat sont peu coûteux, mais les longues sessions de code, les appels d'outils et les décisions en plusieurs étapes exposent souvent les limites de planification. Ling-3.0-tiny est positionné pour les agentic workflows, pas pour un chat ponctuel.
Le déploiement local est central
La fiche du modèle indique une validation sur NVIDIA DGX Spark, Apple Silicon MacBook et Mac mini. En FP8, il atteint environ 100-105 tokens/s sur DGX Spark et 86-90 tokens/s sur un MacBook M4 Pro, avec environ 8,34 GiB de mémoire de pointe à 8K de contexte.
Ces chiffres comptent car ils désignent des machines que les développeurs possèdent déjà. Un MacBook récent ou une petite station de travail peut faire tourner un agent local doté de raisonnement et d'outils. Les données peuvent rester sur l'appareil, et le coût passe des tokens cloud au matériel et à l'électricité.
Les limites restent nettes. La recette SGLang basse latence pour le contexte 256K YaRN et le décodage spéculatif NEXTN mentionne encore un GPU de classe 141GB ou un nœud Blackwell mono-GPU. Les chiffres MacBook concernent FP8, matériel local et contexte 8K.
Les benchmarks fixent le cadre
La fiche rapporte un score de 25 à l'Artificial Analysis Intelligence Index v4.1.1 et 16 à l'Agentic Index. Dans ce test, la vitesse de sortie dépasse 160 tokens/s et une réponse de 500 tokens prend environ 18 secondes de bout en bout, raisonnement inclus.
Ce n'est pas un score de modèle phare. L'argument porte sur l'efficacité par paramètre actif. Ling-3.0-flash obtient un meilleur score sur la même plateforme, mais il est beaucoup plus grand. La version tiny ressemble davantage à un noyau d'exécution local : démarrer, appeler des outils et rester résident.
Les prochains points à suivre sont pratiques : stabilité du support SGLang et vLLM, performance INT4 sur des appareils grand public, et intégration dans les IDE, l'automatisation de navigateur et les outils internes. La fiche montre comment démarrer; les tâches longues diront la valeur réelle.
Sources : fiche modèle Hugging Face, ModelScope, Jiemian, Artificial Analysis, CocoLoop, documentation SGLang ; vérification des 7,9B paramètres totaux, 1,3B actifs, poids BF16/FP8/INT4, architecture KDA/MLA et 128 experts, vitesse locale DGX Spark/M4 Pro, périmètre mémoire 8K, indices Artificial Analysis et périmètre de déploiement SGLang 256K.