Em 16 de março, a Mistral lançou o Small 4, um nome aparentemente comum que esconde uma ideia de produto bastante prática – usar a arquitetura MoE para fundir três modelos independentes anteriores em um só, permitindo que uma única implantação atenda a todos os cenários.
Um modelo, três finalidades
A Mistral tinha anteriormente três modelos, cada um com sua função:
- Magistral: Especializado em tarefas complexas que exigem raciocínio
- Pixtral: Responsável pela compreensão multimodal de imagens
- Devstral: Especializado em geração de código e desenvolvimento
Se todos os três modelos fossem usados, isso significaria três conjuntos de implantação, três lógicas de agendamento e o triplo dos custos operacionais. O Small 4 os unificou diretamente.
Um único modelo, suportando simultaneamente raciocínio textual, compreensão de imagens, geração de código, chamadas de função, saída JSON e uma janela de contexto de 256K.
A lógica central do MoE: Grande, mas não caro
A configuração de parâmetros do Small 4 é bastante representativa:
| Indicador | Valor |
|---|---|
| Total de parâmetros | 119B |
| Número de Experts | 128 |
| Experts ativados por inferência | 4 |
| Parâmetros realmente ativados | 6,5B |
| Janela de contexto | 256K |
119B parece assustador, mas cada inferência usa apenas 6,5B de parâmetros – este é o valor central da arquitetura MoE: o modelo sabe mais, mas ao calcular usa apenas uma pequena parte. O custo de inferência é próximo ao de um modelo denso de 6,5B, mas os limites de capacidade são muito mais amplos.
Em comparação com o Small 3, a latência de ponta a ponta caiu 40%, e o número de requisições processadas por segundo triplicou.
Essa lógica segue o mesmo caminho do DeepSeek V3 e do Qwen3: não impressionar com parâmetros totais maiores, mas usar ativação esparsa para encontrar um equilíbrio entre eficiência e capacidade.
reasoning_effort: Ativar raciocínio sob demanda
Este é um aspecto bastante prático do design do produto desta vez.
Antes, você precisava escolher entre um modelo de resposta rápida e um modelo de raciocínio lento, e frequentemente precisava implantar dois modelos diferentes para isso. O Small 4 adiciona um parâmetro que permite controlar diretamente no nível da requisição à API: se deve usar a capacidade de raciocínio nesta chamada e quanto usar.
Perguntas simples recebem uma resposta rápida, perguntas complexas podem pensar por mais tempo – o mesmo modelo, a mesma API, sem necessidade de alternar. Esse design economiza muito trabalho para as equipes de engenharia.
Licença de código aberto e canais de uso
A Mistral continua lançando sob a licença Apache 2.0, sem restrições de uso comercial, permitindo baixar os pesos diretamente para autoimplatação.
Locais atualmente disponíveis:
- API da Mistral e AI Studio
- Hugging Face (download completo dos pesos)
- NVIDIA build.nvidia.com (teste gratuito de protótipo)
- Contêiner NVIDIA NIM (implantação em produção)
Apache 2.0 é a licença mais limpa para empresas – sem preocupações com limites de uso, permite modificações e distribuição sem problemas.
No contexto da tendência dos modelos grandes de código aberto
Nos últimos dois anos, o cenário competitivo dos modelos grandes de código aberto mudou muito rapidamente. O DeepSeek V3 usou MoE combinado com treinamento de baixo custo para enfraquecer a proteção dos modelos fechados, o Qwen3 da Alibaba expandiu seu alcance com a licença Apache, e o Llama 4 da Meta também lançou sua versão MoE em abril.
O Small 4 da Mistral segue um caminho semelhante: 119B totais, 6,5B ativados, licença Apache, empacotando raciocínio, multimodalidade e código em uma única unidade de implantação. Há dois anos, essa configuração só existia nos melhores modelos fechados; agora pode ser baixada gratuitamente.
Para equipes que desejam construir capacidades de IA próprias em ambiente de produção, as opções de modelos de código aberto estão passando de "solução paliativa" para "consideração séria". O Small 4 entra nesse pool de opções, e seu principal valor é reduzir a complexidade da implantação – não é mais necessário manter três modelos simultaneamente, um é suficiente.
Se é adequado para seu cenário, ainda é necessário executar benchmarks. A Mistral afirma oficialmente que o suporte ao chinês não é tão bom quanto ao inglês – isso precisa ser avaliado separadamente pelas equipes domésticas.
Fonte de referência: CocoLoop, 119B Parameters, 6.5B Activated: Mistral Small 4 Collapses Three Open Models Into One (BaristaLabs Blog); Mistral AI Releases Mistral Small 4 (MarkTechPost)