L'entreprise française d'IA Mistral a publié le 6 octobre un aperçu de recherche de Mistral Large 4. L'entreprise lui a donné le surnom de "le Chonk", qui signifie en gros "le gros bloc". Il s'agit d'un modèle à mélange d'experts (MoE) nativement multimodal, totalisant 1 000 milliards de paramètres, dont environ 49 milliards sont activés par token, avec une fenêtre de contexte de 512K ; il accepte du texte et des images en entrée et produit du texte en sortie.
L'aperçu est pour l'instant accessible via l'API de Mistral, destiné en priorité aux développeurs, aux responsables de cybersécurité et aux administrations publiques ; l'entreprise prévoit d'élargir l'accès plus tard ce mois-ci et de publier les poids ouverts fin octobre.
Entraînement et positionnement
Selon le blog officiel de Mistral, Large 4 a été entraîné à partir de zéro, en utilisant les propres centres de données de l'entreprise en Europe, avec environ 3 800 GPU Nvidia Grace Blackwell ; CNBC rapporte que le cycle d'entraînement a duré environ deux mois. Mistral présente comme points forts la cybersécurité, la programmation, l'industrie, la finance et les tâches multimodales.
Publiquement, l'entreprise affirme que Large 4 est "le modèle à poids ouverts le plus puissant hors de Chine, et avec une large marge". CNBC rapporte également que Mistral reconnaît rester en retard par rapport aux modèles fermés les plus avancés dans des domaines comme la programmation.
L'API propose deux modes de raisonnement : none et high. Le développeur Simon Willison, en testant le modèle, a constaté que le mode high génère en moyenne moins de tokens (2 717) que le mode none (3 275), et que les résultats sont également meilleurs en mode high. Son évaluation globale est que Large 4 accuse environ six mois de retard sur la pointe de l'état de l'art.
Comment les tiers le notent
L'évaluateur indépendant Artificial Analysis lui attribue 38 points à l'Intelligence Index. En comparaison :
| Modèle | Intelligence Index |
|---|---|
| DeepSeek V4.1 Flash | 39 |
| Mistral Large 4 | 38 |
| GPT-6 Luna (max) | 38 |
| Mistral Large 3 | 9 |
L'écart entre les deux générations est de 29 points ; la version précédente, Large 3, avec 9 points, se retrouve clairement en retrait dans ce classement. Artificial Analysis qualifie ainsi Large 4 de "modèle le plus intelligent hors des États-Unis et de la Chine". Sur l'indice de cybersécurité de cet évaluateur, Large 4 obtient 50 points, mais le test de raisonnement documentaire (GDP.pdf) n'affiche qu'un taux de réussite de 19 %, un point clairement faible.
Faire les comptes
Le tarif de l'API pendant l'aperçu est de 1,36 dollar par million de tokens en entrée et 4,18 dollars par million de tokens en sortie, avec 0,14 dollar par million pour les tokens en entrée qui touchent le cache ; une remise de 50 % s'applique les deux premières semaines. Artificial Analysis convertit cela selon son propre ensemble de tâches, pour un coût de 1,13 dollar par tâche, ou 0,57 dollar pendant la période de remise.
Calcul rapide d'un scénario courant : injecter 1 million de tokens de code ou de documents et obtenir 200 000 tokens en sortie coûte environ 2,2 dollars au tarif plein, et environ 1,1 dollar pendant la période de remise. Le prix de la sortie est environ trois fois celui de l'entrée, donc les tâches d'agents à sortie longue reviennent plus cher.
Le taux d'activation se calcule aussi : 49 milliards de paramètres activés sur 1 000 milliards au total, soit environ 4,9 %, proche de Reflection Beam, publié la veille (23 milliards activés sur 501 milliards au total, environ 4,6 %). Le coût d'inférence suivant surtout les paramètres activés, les deux entreprises aiment mettre en avant leur "efficacité".
Le seuil de déploiement est une autre affaire. En précision 8 bits, le simple stockage des poids d'un modèle à 1 000 milliards de paramètres nécessite environ 1 To de VRAM, et encore environ 500 Go en quantification 4 bits ; une fois les poids ouverts récupérés, la plupart des équipes devront probablement encore recourir à un hébergement cloud ou attendre des versions distillées par la communauté.
La carte européenne
Mistral vient de boucler en septembre un tour de financement de 3 milliards d'euros, mené par Samsung. Large 4 est le premier modèle phare publié depuis l'arrivée de ces fonds ; l'entreprise insiste à plusieurs reprises sur ses capacités de calcul propres et sur un entraînement réalisé en sol européen, ce qui, à en juger par l'axe de sa communication, vise les marchés publics des gouvernements européens et des secteurs régulés.
Les conditions de licence des poids ouverts et la date de publication exacte n'ont pas encore été annoncées par Mistral. Pour l'instant, tous les scores ne proviennent que des données officielles et de quelques évaluateurs indépendants ; on ne saura que fin du mois ce que la communauté parviendra à reproduire une fois les poids en main.
Sources : blog officiel de Mistral, Artificial Analysis, CocoLoop, CNBC, blog de Simon Willison ; l'Intelligence Index et le coût par tâche suivent les données publiées par Artificial Analysis, les tarifs de l'API suivent la grille de l'aperçu de Mistral, et l'estimation de VRAM est un calcul approximatif fondé sur le nombre de paramètres.