El 27 de septiembre, MiniMax lanzó el nuevo modelo de texto M3.1-Flash-Preview en su propia herramienta de programación, MiniMax Code. Según el posicionamiento oficial, está pensado para el desarrollo del día a día, desde corregir pequeños errores hasta construir funciones completas. Ese mismo día, MiniMax reinició las cuotas del Token Plan para todos los usuarios y emitió tarjetas adicionales de reinicio; del 28 de septiembre al 7 de octubre, los puntos de check-in en MiniMax Code se duplican, tanto para usuarios nuevos como antiguos, y pueden usarse en cualquier modelo.
Por ahora, el modelo solo es accesible por dos vías: la suscripción Token Plan y MiniMax Code. La API pública de pago por uso todavía no está disponible.
Lo que confirma la documentación
La documentación de integración de la plataforma abierta de MiniMax ya incluye una entrada para este modelo, con las siguientes especificaciones confirmadas:
- Contexto de 1 millón de tokens, pensado para documentos largos, bases de código completas y sesiones de agentes de varios pasos;
- Velocidad de salida nominal de más de 100 tokens por segundo;
- La entrada admite texto, imagen y video;
- El parámetro
effortajusta la profundidad de razonamiento en cinco niveles: low, medium, high, xhigh, max; si no se especifica, el valor por defecto es max.
Hay una limitación claramente indicada: el razonamiento de este modelo no se puede desactivar. Si al llamarlo se intenta apagar el reasoning, la API devuelve directamente un error 400; la documentación recomienda bajar el nivel de effort para quien busque menor latencia. En cuanto a la integración, MiniMax ofrece endpoints tanto al estilo Anthropic como al estilo OpenAI, marcando el primero como recomendado.
Lo que no se ha anunciado
Este lanzamiento fue bastante discreto. Medios especializados notaron que MiniMax no emitió un anuncio oficial, y que no hay model card, informe de evaluación ni precios. El ranking de terceros BenchLM registraba cero resultados de benchmark para el modelo hasta el 27 de septiembre.
Ese mismo medio mencionó además un repositorio restringido en Hugging Face llamado MiniMax-M3.1-preview-private, de unos 250 GB, que los usuarios externos no pueden descargar. Si se trata de los pesos de la versión Flash preview, y si más adelante se abrirá como M3, MiniMax no ha respondido por ahora. Tampoco hay cifras en la documentación sobre cuánto cómputo consume cada uno de los cinco niveles de effort ni cuánto varía la latencia entre ellos.
Frente a M3, un ritmo de lanzamiento distinto
M3, lanzado el 1 de junio, siguió otro enfoque: pesos abiertos, contexto de 1 millón de tokens y multimodalidad nativa se publicaron juntos, acompañados de la arquitectura de atención dispersa desarrollada internamente, MSA, y un conjunto completo de benchmarks de programación: SWE-Bench Pro registró 59,0 % y Terminal-Bench 2.1, 66,0 %. En aquel momento, MiniMax convirtió el "contexto de un millón de tokens asequible" en su principal argumento de venta, con abundantes cifras.
M3.1-Flash-Preview sigue el camino contrario: primero el producto, después la documentación. Se deja que los usuarios de pago lo prueben primero en MiniMax Code, mientras los reinicios de cuota y las campañas de check-in atraen de vuelta a los usuarios. Los nombres Flash y Preview también delatan su posición: uno es un nivel ligero orientado a la velocidad, y el otro todavía no está definido.
Este ritmo se ha vuelto bastante común últimamente entre los modelos de programación chinos. El MiMo-V2.6 de Xiaomi se divide en Pro y Flash, con Flash siguiendo la vía de la eficiencia; DeepSeek v4.1 Flash gana usuarios mediante cuotas gratuitas de la herramienta de programación extranjera OpenCode; Zhipu también tiene su GLM-5.3-Flash. Los usuarios de herramientas de programación son los más sensibles al precio y a la velocidad de respuesta, así que lanzar primero el nivel ligero y completar los benchmarks después permite obtener antes retroalimentación real de uso.
Para los desarrolladores chinos que quieran probar este modelo ahora mismo, hace falta una suscripción Token Plan o usar directamente MiniMax Code. El effort viene por defecto en el nivel más alto; quien solo corrija errores pequeños obtendrá respuestas más rápidas y ahorrará cuota bajándolo uno o dos niveles. En cuanto a cuánto más rápido es respecto a M3 y si baja la calidad del código, habrá que esperar a que MiniMax publique sus evaluaciones o a que terceros ejecuten los benchmarks.
Fuentes: cuentas oficiales de MiniMax en redes sociales, documentación de integración de la plataforma abierta de MiniMax, AlphaSignal, CocoLoop, BenchLM; la longitud de contexto, los niveles de effort y los límites de integración se verificaron según la documentación de MiniMax; los benchmarks de M3 son autoinformados por el fabricante.