Ling apunta a agentes locales

El nuevo modelo pequeño Ling de InclusionAI puede parecer otra publicación sobre eficiencia. Su objetivo real es más concreto: ser una base de ejecución para agentes locales.

El 11 de agosto, el equipo Ling de Ant Group abrió Ling-3.0-tiny. Jiemian informó los datos básicos: 7,9B parámetros totales, solo 1,3B parámetros activados por token y pesos BF16, FP8 e INT4. La tarjeta de modelo en Hugging Face, ModelScope y la documentación de SGLang aportan los detalles de despliegue.

“We are introducing Ling-3.0-tiny, a lightweight hybrid reasoning MoE model”

Por qué un modelo pequeño habla de agentes

Ling-3.0-tiny usa una pila alterna 3:1 de Kimi Delta Attention y Multi-Head Latent Attention. Su capa sparse MoE FFN tiene 128 expertos enrutados; cada token activa 8 expertos enrutados y 1 experto compartido.

El punto técnico es claro: contexto largo, baja memoria y tareas de agentes con herramientas deben convivir. Los modelos pequeños de chat pueden ser baratos, pero sesiones largas de programación, llamadas a herramientas y decisiones de varios pasos revelan límites de planificación y contexto. Ling-3.0-tiny se presenta para agentic workflows, no para un chat de una sola vuelta.

El despliegue local es el centro

La tarjeta del modelo dice que fue validado en NVIDIA DGX Spark, Apple Silicon MacBook y Mac mini. Con FP8, alcanza unos 100-105 tokens/s en DGX Spark y 86-90 tokens/s en un MacBook M4 Pro, con unos 8,34 GiB de memoria pico en contexto 8K.

Esos datos apuntan a máquinas que los desarrolladores ya tienen. Un MacBook reciente o una pequeña estación de trabajo puede ejecutar un agente local con razonamiento y herramientas. Los datos pueden quedarse en el dispositivo, y el coste pasa de tokens en la nube a hardware y electricidad.

Los límites también importan. La receta de baja latencia de SGLang para contexto 256K YaRN y decodificación especulativa NEXTN todavía menciona una GPU de clase 141GB o un nodo Blackwell de una GPU. Las cifras del MacBook corresponden a FP8, hardware local y contexto 8K.

Los benchmarks marcan el límite

La tarjeta del modelo reporta 25 puntos en Artificial Analysis Intelligence Index v4.1.1 y 16 en Agentic Index. En esa prueba, la velocidad de salida supera 160 tokens/s y una respuesta de 500 tokens tarda unos 18 segundos de extremo a extremo, incluido el razonamiento.

No es una puntuación de modelo insignia. El valor está en la eficiencia por parámetro activo. Ling-3.0-flash puntúa más alto en la misma plataforma, pero también es mucho mayor. La versión tiny se parece más a un núcleo local de ejecución: arrancar, llamar herramientas y permanecer residente.

Lo siguiente será práctico: estabilidad de SGLang y vLLM, rendimiento de INT4 en dispositivos de consumo e integración en IDE, automatización de navegador y herramientas internas. La tarjeta muestra cómo iniciarlo; las tareas largas dirán cuánto vale.

Fuentes: tarjeta de modelo Hugging Face, ModelScope, Jiemian, Artificial Analysis, CocoLoop, documentación de SGLang; verificación de 7,9B parámetros totales, 1,3B activos, pesos BF16/FP8/INT4, arquitectura KDA/MLA y 128 expertos, velocidad local DGX Spark/M4 Pro, alcance de memoria 8K, índices Artificial Analysis y alcance de despliegue SGLang 256K.