Ling mira agentes locais

O novo modelo pequeno Ling da InclusionAI pode parecer mais um lançamento de eficiência. O alvo real é mais preciso: servir como base de execução para agentes locais.

Em 11 de agosto, a equipe Ling do Ant Group abriu o Ling-3.0-tiny. A Jiemian informou os fatos centrais: 7,9B parâmetros totais, apenas 1,3B parâmetros ativados por token e pesos BF16, FP8 e INT4. O model card no Hugging Face, a página ModelScope e a documentação SGLang trazem os detalhes técnicos de implantação.

“We are introducing Ling-3.0-tiny, a lightweight hybrid reasoning MoE model”

Por que um modelo pequeno fala de agentes

O Ling-3.0-tiny usa uma pilha alternada 3:1 de Kimi Delta Attention e Multi-Head Latent Attention. A camada sparse MoE FFN tem 128 routed experts; cada token ativa 8 routed experts e 1 shared expert.

O objetivo técnico é claro: contexto longo, pouca memória e tarefas de agente com uso de ferramentas precisam coexistir. Modelos pequenos de chat podem ser baratos, mas sessões longas de código, chamadas de ferramentas e decisões em várias etapas expõem limites de planejamento. O Ling-3.0-tiny é apresentado para agentic workflows, não para chat de uma rodada.

Implantação local é o centro

O model card diz que o modelo foi validado em NVIDIA DGX Spark, Apple Silicon MacBook e Mac mini. Com FP8, chega a cerca de 100-105 tokens/s no DGX Spark e 86-90 tokens/s em um MacBook M4 Pro, com pico de memória de cerca de 8,34 GiB em contexto 8K.

Esses números importam porque apontam para máquinas que desenvolvedores já têm. Um MacBook recente ou uma workstation pequena pode executar um agente local com raciocínio e ferramentas. Os dados podem ficar no dispositivo, e o custo sai da cobrança por token na nuvem para hardware e energia.

Os limites também são claros. A receita SGLang de baixa latência para contexto 256K YaRN e decodificação especulativa NEXTN ainda cita uma GPU de classe 141GB ou um nó Blackwell de uma GPU. Os números do MacBook valem para FP8, hardware local e contexto 8K.

Benchmarks definem a posição

O model card informa pontuação 25 no Artificial Analysis Intelligence Index v4.1.1 e 16 no Agentic Index. Nesse teste, a velocidade de saída passa de 160 tokens/s e uma resposta de 500 tokens leva cerca de 18 segundos ponta a ponta, incluindo o tempo de raciocínio.

Isso não faz dele um modelo topo de linha. O argumento é eficiência por parâmetro ativo. O Ling-3.0-flash pontua mais alto na mesma plataforma, mas também é muito maior. A versão tiny parece um núcleo local de execução: roda, chama ferramentas e fica residente.

Os próximos pontos são práticos: estabilidade do suporte em SGLang e vLLM, desempenho do INT4 em dispositivos de consumo e integração com IDEs, automação de navegador e ferramentas internas. O model card mostra como iniciar; tarefas longas dirão o valor.

Fontes: model card Hugging Face, ModelScope, Jiemian, Artificial Analysis, CocoLoop, documentação SGLang; verificação cobre 7,9B parâmetros totais, 1,3B ativos, pesos BF16/FP8/INT4, arquitetura KDA/MLA e 128 experts, velocidade local DGX Spark/M4 Pro, escopo de memória 8K, índices Artificial Analysis e escopo de implantação SGLang 256K.