Das französische KI-Unternehmen Mistral hat am 6. Oktober eine Forschungsvorschau von Mistral Large 4 veröffentlicht. Intern trägt das Modell den Spitznamen "le Chonk", was ungefähr "der Brocken" bedeutet. Es handelt sich um ein nativ multimodales Mixture-of-Experts-Modell (MoE) mit insgesamt einer Billion Parametern, von denen pro Token rund 49 Milliarden aktiv sind, mit einem Kontextfenster von 512K; es verarbeitet Text- und Bildeingaben und liefert Textausgaben.
Die Vorschau steht derzeit über die Mistral-API zur Verfügung, vorrangig für Entwickler, Sicherheitsverantwortliche und Behörden; das Unternehmen will den Zugang noch im Laufe des Monats erweitern und Ende Oktober die offenen Gewichte veröffentlichen.
Training und Positionierung
Laut dem offiziellen Mistral-Blog wurde Large 4 von Grund auf trainiert, und zwar in den eigenen Rechenzentren des Unternehmens in Europa mit rund 3.800 Nvidia-Grace-Blackwell-GPUs; laut CNBC dauerte der Trainingszyklus etwa zwei Monate. Als Stärken nennt Mistral Cybersicherheit, Programmierung, Fertigung, Finanzwesen und multimodale Aufgaben.
Nach außen erklärt das Unternehmen, Large 4 sei "das stärkste Open-Weight-Modell außerhalb Chinas, und zwar mit deutlichem Abstand". CNBC berichtet zugleich, Mistral räume ein, in Bereichen wie Programmierung weiterhin hinter den fortschrittlichsten Closed-Source-Modellen zurückzuliegen.
Die API bietet zwei Reasoning-Modi: none und high. Entwickler Simon Willison stellte beim Testen fest, dass der Modus high im Schnitt sogar weniger Token ausgibt (2.717) als none (3.275), und dass die Ergebnisse im high-Modus zugleich besser ausfallen. Seine Gesamteinschätzung: Large 4 liegt etwa ein halbes Jahr hinter der Spitze.
Wie Dritte es bewerten
Die unabhängige Prüfstelle Artificial Analysis vergibt im Intelligence Index 38 Punkte. Im Vergleich:
| Modell | Intelligence Index |
|---|---|
| DeepSeek V4.1 Flash | 39 |
| Mistral Large 4 | 38 |
| GPT-6 Luna (max) | 38 |
| Mistral Large 3 | 9 |
Zwischen den beiden Generationen liegen 29 Punkte, die Vorgängerversion Large 3 fällt mit 9 Punkten in dieser Liste deutlich zurück. Artificial Analysis bezeichnet Large 4 deshalb als "das intelligenteste Modell außerhalb der USA und Chinas". Im Cybersicherheits-Index der Prüfstelle erreicht Large 4 50 Punkte, bei dem Dokumenten-Reasoning-Test (GDP.pdf) liegt die Erfolgsquote jedoch nur bei 19 % – hier zeigt sich eine klare Schwäche.
Eine Kostenrechnung
Die API-Preise der Vorschau liegen bei 1,36 US-Dollar pro Million Input-Token und 4,18 US-Dollar pro Million Output-Token, bei Cache-Treffern 0,14 US-Dollar pro Million Input-Token; in den ersten zwei Wochen gibt es 50 % Rabatt. Artificial Analysis rechnet das anhand des eigenen Aufgabensets auf Kosten pro Aufgabe um: 1,13 US-Dollar regulär, 0,57 US-Dollar im Rabattzeitraum.
Grobe Beispielrechnung: Werden 1 Million Token Code oder Dokumente eingespeist und 200.000 Token Ausgabe erzeugt, kostet das zum regulären Preis rund 2,2 US-Dollar, im Rabattzeitraum rund 1,1 US-Dollar. Der Output-Preis liegt etwa beim Dreifachen des Input-Preises, weshalb Agenten-Aufgaben mit langer Ausgabe teurer ausfallen.
Auch das Aktivierungsverhältnis lässt sich ausrechnen: 49 Milliarden aktive Parameter bei insgesamt einer Billion ergeben etwa 4,9 % – nahe an Reflection Beam, das einen Tag zuvor erschien (23 Milliarden aktive bei insgesamt 501 Milliarden Parametern, rund 4,6 %). Da die Inferenzkosten vor allem von den aktiven Parametern abhängen, betonen beide Unternehmen gerne ihre "Effizienz".
Die Einstiegshürde für den Einsatz steht auf einem anderen Blatt. Bei 8-Bit-Genauigkeit benötigt allein die Speicherung der Gewichte von einer Billion Parametern rund 1 TB VRAM, bei 4-Bit-Quantisierung noch etwa 500 GB; die meisten Teams werden nach Erhalt der offenen Gewichte wohl weiterhin auf Cloud-Hosting angewiesen sein oder auf destillierte Community-Versionen warten.
Die Europa-Karte
Mistral hat im September gerade eine Finanzierungsrunde über 3 Milliarden Euro abgeschlossen, angeführt von Samsung. Large 4 ist das erste Flaggschiffmodell nach Eingang dieses Kapitals; eigene Rechenkapazitäten und das Training auf europäischem Boden werden vom Unternehmen immer wieder hervorgehoben – in der Kommunikation richtet sich das Modell klar an Beschaffungsentscheidungen europäischer Regierungen und regulierter Branchen.
Die Lizenzbedingungen für die offenen Gewichte und das genaue Veröffentlichungsdatum hat Mistral bislang nicht bekanntgegeben. Auch alle bisherigen Bewertungen stammen nur vom Unternehmen selbst und wenigen Prüfstellen; wie viel die Community nach Erhalt der Gewichte reproduzieren kann, zeigt sich erst zum Monatsende.
Quellen: offizieller Mistral-Blog, Artificial Analysis, CocoLoop, CNBC, Simon Willisons Blog; Intelligence Index und Kosten pro Aufgabe gemäß den veröffentlichten Daten von Artificial Analysis, API-Preise gemäß der Vorschau-Preisliste von Mistral, VRAM-Bedarf grob nach Parameterzahl geschätzt.