Le 16 mars, Mistral a publié Small 4, un nom qui semble anodin mais qui cache une idée produit assez pratique : utiliser l'architecture MoE pour fusionner trois modèles indépendants précédents en un seul, de sorte qu'un seul déploiement couvre tous les scénarios.
Un modèle, trois usages
Mistral avait auparavant trois modèles, chacun avec une fonction spécifique :
- Magistral : Spécialisé dans les tâches complexes nécessitant du raisonnement
- Pixtral : Chargé de la compréhension multimodale d'images
- Devstral : Spécialisé dans la génération de code et le développement
Si les trois modèles devaient être utilisés, cela signifiait trois systèmes de déploiement, trois logiques d'ordonnancement et trois fois les coûts d'exploitation. Small 4 les a directement unifiés.
Un seul modèle, prenant en charge simultanément le raisonnement textuel, la compréhension d'images, la génération de code, les appels de fonction, la sortie JSON et une fenêtre de contexte de 256K.
La logique centrale du MoE : Grand, mais pas cher
La configuration des paramètres de Small 4 est très représentative :
| Indicateur | Valeur |
|---|---|
| Nombre total de paramètres | 119B |
| Nombre d'experts | 128 |
| Experts activés par inférence | 4 |
| Paramètres réellement activés | 6,5B |
| Fenêtre de contexte | 256K |
119B semble impressionnant, mais chaque inférence n'utilise que 6,5B de paramètres – c'est la valeur centrale de l'architecture MoE : le modèle en sait plus, mais lors du calcul, il n'en utilise qu'une petite partie. Le coût d'inférence est proche de celui d'un modèle dense de 6,5B, mais les limites de capacité sont bien plus larges.
Par rapport à Small 3, la latence de bout en bout a diminué de 40 %, et le nombre de requêtes traitées par seconde a triplé.
Cette logique suit la même voie que DeepSeek V3 et Qwen3 : ne pas impressionner par des paramètres totaux plus importants, mais utiliser l'activation sparse pour trouver un équilibre entre efficacité et capacité.
reasoning_effort : Activer la capacité de raisonnement à la demande
C'est un aspect assez pratique de la conception du produit cette fois-ci.
Auparavant, il fallait choisir entre un modèle à réponse rapide et un modèle à raisonnement lent, et il était souvent nécessaire de déployer deux modèles différents pour y parvenir. Small 4 ajoute un paramètre qui permet de contrôler directement au niveau de la requête API : faut-il utiliser la capacité de raisonnement pour cette requête et dans quelle mesure ?
Les questions simples reçoivent une réponse rapide, les questions complexes peuvent réfléchir plus longtemps – le même modèle, la même API, sans avoir à basculer. Cette conception fait gagner beaucoup de temps aux équipes d'ingénierie.
Licence open source et canaux d'utilisation
Mistral continue de publier sous licence Apache 2.0, sans restriction d'utilisation commerciale, permettant de télécharger directement les poids pour un auto-déploiement.
Endroits actuellement disponibles :
- API Mistral et AI Studio
- Hugging Face (téléchargement complet des poids)
- NVIDIA build.nvidia.com (test de prototype gratuit)
- Conteneur NVIDIA NIM (déploiement en production)
Apache 2.0 est la licence la plus propre pour les entreprises – pas d'inquiétude concernant les limites d'utilisation, les modifications sont autorisées et la distribution est sans problème.
Dans le contexte de la tendance des grands modèles open source
Ces deux dernières années, le paysage concurrentiel des grands modèles open source a changé très rapidement. DeepSeek V3 a utilisé MoE combiné à un entraînement à faible coût pour affaiblir les défenses des modèles fermés, Qwen3 d'Alibaba a élargi son marché avec la licence Apache, et Llama 4 de Meta a également publié sa version MoE en avril.
Small 4 de Mistral suit une voie similaire : 119B au total, 6,5B activés, licence Apache, regroupant raisonnement, multimodalité et code dans une seule unité de déploiement. Il y a deux ans, cette configuration n'existait que dans les meilleurs modèles fermés ; aujourd'hui, elle peut être téléchargée gratuitement.
Pour les équipes qui souhaitent construire leurs propres capacités d'IA en environnement de production, les options de modèles open source passent d'une « solution de dépannage » à une « considération sérieuse ». Small 4 rejoint ce pool d'options, et sa valeur principale est de réduire la complexité du déploiement – il n'est plus nécessaire de maintenir trois modèles simultanément, un seul suffit.
Pour savoir s'il convient à votre scénario, il faut encore exécuter des benchmarks. Mistral déclare officiellement que la prise en charge du chinois n'est pas aussi bonne que celle de l'anglais – cela doit être évalué séparément par les équipes locales.
Source de référence : CocoLoop, 119B Parameters, 6.5B Activated: Mistral Small 4 Collapses Three Open Models Into One (BaristaLabs Blog) ; Mistral AI Releases Mistral Small 4 (MarkTechPost)