Le 27 septembre, MiniMax a mis en ligne son nouveau modèle de texte M3.1-Flash-Preview sur son propre outil de programmation, MiniMax Code. Selon le positionnement officiel, il vise le développement quotidien, de la correction de petits bugs à la construction de fonctionnalités complètes. Le même jour, MiniMax a réinitialisé les quotas du Token Plan pour tous les utilisateurs et distribué des cartes de réinitialisation supplémentaires ; du 28 septembre au 7 octobre, les points de check-in sur MiniMax Code sont doublés, pour les nouveaux comme les anciens utilisateurs, utilisables sur tous les modèles.
Pour l'instant, ce modèle n'est accessible que par deux canaux : l'abonnement Token Plan et MiniMax Code. L'API publique facturée à l'usage n'est pas encore ouverte.
Ce que la documentation confirme
La documentation d'intégration de la plateforme ouverte de MiniMax comporte déjà une entrée pour ce modèle, avec les spécifications suivantes confirmées :
- Un contexte d'un million de tokens, destiné aux documents longs, aux bases de code entières et aux sessions d'agents à plusieurs étapes ;
- Une vitesse de sortie annoncée à plus de 100 tokens par seconde ;
- Une entrée qui prend en charge le texte, l'image et la vidéo ;
- Un paramètre
effortqui règle la profondeur de raisonnement sur cinq niveaux : low, medium, high, xhigh, max — sans précision, la valeur par défaut est max.
Une limite est clairement indiquée : le raisonnement de ce modèle ne peut pas être désactivé. Si un appel tente de couper le reasoning, l'API renvoie directement une erreur 400 ; la documentation conseille plutôt de baisser le niveau d'effort pour réduire la latence. Côté intégration, MiniMax propose à la fois un endpoint de style Anthropic et un endpoint de style OpenAI, le premier étant marqué comme recommandé.
Ce qui n'a pas été annoncé
Ce lancement est resté plutôt discret. Des médias spécialisés ont remarqué que MiniMax n'a publié aucune annonce officielle, et qu'il n'existe ni model card, ni rapport d'évaluation, ni grille tarifaire. Le classement tiers BenchLM ne comptait toujours aucun résultat de benchmark pour ce modèle au 27 septembre.
Ce même média a également signalé l'apparition sur Hugging Face d'un dépôt à accès restreint nommé MiniMax-M3.1-preview-private, d'environ 250 Go, que les personnes extérieures ne peuvent pas télécharger. S'agit-il des poids de la version Flash preview, et seront-ils ouverts plus tard comme pour M3 ? MiniMax n'a pour l'instant pas répondu. La documentation ne donne pas non plus de chiffres sur la consommation de calcul de chacun des cinq niveaux d'effort, ni sur l'écart de latence entre eux.
Face à M3, un rythme de lancement différent
M3, sorti le 1er juin, suivait une autre logique : poids ouverts, contexte d'un million de tokens et multimodalité native publiés d'un seul coup, accompagnés de l'architecture d'attention creuse maison MSA et de tout un ensemble de benchmarks de programmation — SWE-Bench Pro à 59,0 % et Terminal-Bench 2.1 à 66,0 %. À l'époque, MiniMax avait fait du « contexte d'un million de tokens abordable » son principal argument de vente, avec des chiffres à l'appui.
M3.1-Flash-Preview prend le chemin inverse : le produit d'abord, la documentation ensuite. Les utilisateurs payants sont invités à l'essayer directement dans MiniMax Code, pendant que les réinitialisations de quota et les opérations de check-in ramènent du monde. Les noms Flash et Preview trahissent d'ailleurs sa place : un niveau léger tourné vers la vitesse, qui n'est en outre pas encore figé.
Ce rythme est devenu assez courant ces derniers temps chez les modèles de programmation chinois. Le MiMo-V2.6 de Xiaomi se décline en Pro et Flash, ce dernier misant sur l'efficacité ; DeepSeek v4.1 Flash gagne des utilisateurs grâce aux quotas gratuits de l'outil de programmation étranger OpenCode ; Zhipu propose aussi son GLM-5.3-Flash. Les utilisateurs d'outils de programmation sont particulièrement sensibles au prix et à la vitesse de réponse, donc sortir d'abord la version légère puis compléter les benchmarks permet de récolter plus vite de vrais retours d'usage.
Pour les développeurs chinois qui veulent tester ce modèle dès maintenant, il faut soit un abonnement Token Plan, soit passer directement par MiniMax Code. Le niveau d'effort par défaut est le plus élevé ; pour de simples corrections de bugs, le baisser d'un ou deux crans accélère les réponses et économise du quota. Quant à savoir de combien il est plus rapide que M3 et si la qualité du code en pâtit, il faudra attendre que MiniMax publie ses propres évaluations, ou que des tiers fassent tourner les benchmarks.
Sources : comptes officiels de MiniMax sur les réseaux sociaux, documentation d'intégration de la plateforme ouverte de MiniMax, AlphaSignal, CocoLoop, BenchLM ; la longueur de contexte, les niveaux d'effort et les limites d'intégration ont été vérifiés d'après la documentation de MiniMax, les benchmarks de M3 étant autodéclarés par le fabricant.