Am 27. September hat MiniMax das neue Textmodell M3.1-Flash-Preview in seinem eigenen Coding-Produkt MiniMax Code veröffentlicht. Offiziell ist es für die tägliche Entwicklung gedacht, von kleinen Bugfixes bis zu kompletten Features. Am selben Tag setzte MiniMax die Token-Plan-Kontingente aller Nutzer zurück und gab zusätzliche Reset-Karten aus; vom 28. September bis 7. Oktober werden die Check-in-Punkte in MiniMax Code verdoppelt, sowohl für neue als auch bestehende Nutzer, einlösbar bei allen Modellen.
Aktuell ist das Modell nur über zwei Wege zugänglich: ein Token-Plan-Abo und MiniMax Code. Eine nutzungsabhängig abgerechnete öffentliche API gibt es noch nicht.
Was die Dokumentation bestätigt
Die Integrationsdokumentation der MiniMax Open Platform listet das Modell bereits, folgende Spezifikationen sind bestätigt:
- 1 Million Token Kontext, ausgelegt auf lange Dokumente, ganze Codebasen und mehrstufige Agenten-Sessions;
- Ausgabegeschwindigkeit von nominell über 100 Token pro Sekunde;
- Eingabe unterstützt Text, Bilder und Video;
- Der Parameter
effortsteuert die Denktiefe in fünf Stufen: low, medium, high, xhigh, max – ohne Angabe ist max der Standard.
Eine Einschränkung ist klar dokumentiert: Das Reasoning dieses Modells lässt sich nicht abschalten. Wer beim Aufruf versucht, es zu deaktivieren, bekommt direkt einen 400-Fehler zurück; die Dokumentation empfiehlt, für niedrigere Latenz stattdessen die effort-Stufe zu senken. Bei der Anbindung bietet MiniMax sowohl einen Anthropic- als auch einen OpenAI-Style-Endpunkt an, wobei ersterer als empfohlen markiert ist.
Was nicht veröffentlicht wurde
Der Launch verlief recht zurückhaltend. Fachmedien haben bemerkt, dass MiniMax keine offizielle Ankündigung herausgegeben hat und weder Modellkarte noch Evaluationsbericht noch Preise vorliegen. Das Drittanbieter-Ranking BenchLM verzeichnete bis zum 27. September null Benchmark-Ergebnisse für das Modell.
Dasselbe Medium erwähnte zudem ein zugriffsbeschränktes Repository auf Hugging Face namens MiniMax-M3.1-preview-private mit rund 250 GB Größe, das Außenstehende nicht herunterladen können. Ob es sich dabei um die Gewichte der Flash-Preview handelt und ob diese später wie bei M3 offengelegt werden, dazu hat sich MiniMax bisher nicht geäußert. Wie viel Rechenleistung die fünf effort-Stufen jeweils verbrauchen und wie stark sich die Latenz unterscheidet, dazu fehlen ebenfalls Zahlen in der Dokumentation.
Im Vergleich zu M3: ein anderer Veröffentlichungsrhythmus
M3, veröffentlicht am 1. Juni, verfolgte einen anderen Ansatz: offene Gewichte, 1 Million Kontext und native Multimodalität kamen gleichzeitig, dazu die selbst entwickelte Sparse-Attention-Architektur MSA und ein komplettes Set an Coding-Benchmarks – SWE-Bench Pro erreichte 59,0 %, Terminal-Bench 2.1 66,0 %. Damals machte MiniMax "bezahlbaren Millionen-Token-Kontext" zum Hauptverkaufsargument, mit reichlich Zahlen.
M3.1-Flash-Preview geht den umgekehrten Weg: erst das Produkt, die Unterlagen später. Zahlende Nutzer sollen es zunächst in MiniMax Code ausprobieren, während Kontingent-Resets und Check-in-Aktionen Nutzer zurückholen. Auch die Namen Flash und Preview verraten die Positionierung – eine leichte, auf Geschwindigkeit ausgelegte Stufe, die zudem noch nicht final ist.
Dieser Rhythmus ist bei chinesischen Coding-Modellen zuletzt recht verbreitet. Xiaomis MiMo-V2.6 teilt sich in Pro und Flash, wobei Flash auf Effizienz setzt; DeepSeek v4.1 Flash gewinnt Nutzer über Gratis-Kontingente des ausländischen Coding-Tools OpenCode; auch Zhipu hat mit GLM-5.3-Flash eine solche Variante. Nutzer von Coding-Tools reagieren besonders sensibel auf Preis und Antwortzeit – erst die leichte Stufe zu bringen und Benchmarks nachzuliefern, liefert schneller echtes Nutzungsfeedback.
Wer in China das Modell jetzt schon ausprobieren will, braucht entweder ein Token-Plan-Abo oder nutzt direkt MiniMax Code. Der effort-Parameter steht standardmäßig auf der höchsten Stufe; wer nur kleine Bugs fixt, bekommt mit ein bis zwei Stufen niedriger schnellere Antworten und spart Kontingent. Wie viel schneller es gegenüber M3 ist und ob die Codequalität leidet, lässt sich erst sagen, wenn MiniMax eigene Auswertungen veröffentlicht oder Dritte die Benchmarks nachgefahren haben.
Quellen: offizielle Social-Media-Konten von MiniMax, Integrationsdokumentation der MiniMax Open Platform, AlphaSignal, CocoLoop, BenchLM; Kontextlänge, effort-Stufen und Integrationsgrenzen wurden anhand der MiniMax-Dokumentation geprüft, die M3-Benchmarks stammen vom Hersteller selbst.