El 16 de marzo, Mistral lanzó Small 4, un nombre que parece común pero que esconde una idea de producto bastante práctica: usar la arquitectura MoE para fusionar tres modelos independientes anteriores en uno solo, de modo que un único despliegue cubra todos los escenarios.
Un modelo, tres propósitos
Anteriormente, Mistral tenía tres modelos, cada uno con una función específica:
- Magistral: Especializado en tareas complejas que requieren razonamiento
- Pixtral: Encargado de la comprensión multimodal de imágenes
- Devstral: Especializado en generación de código y desarrollo
Si se usaran los tres modelos, eso implicaría tres sistemas de despliegue, tres lógicas de programación y el triple de costos operativos. Small 4 los unificó directamente.
Un solo modelo que admite simultáneamente razonamiento textual, comprensión de imágenes, generación de código, llamadas a funciones, salida JSON y una ventana de contexto de 256K.
La lógica central de MoE: Grande, pero no caro
La configuración de parámetros de Small 4 es muy representativa:
| Indicador | Valor |
|---|---|
| Parámetros totales | 119B |
| Número de Experts | 128 |
| Experts activados por inferencia | 4 |
| Parámetros realmente activados | 6,5B |
| Ventana de contexto | 256K |
119B suena impresionante, pero cada inferencia solo utiliza 6,5B de parámetros: este es el valor central de la arquitectura MoE: el modelo sabe más, pero al calcular solo usa una pequeña parte. El costo de inferencia es cercano al de un modelo denso de 6,5B, pero los límites de capacidad son mucho más amplios.
En comparación con Small 3, la latencia de extremo a extremo se redujo en un 40 %, y la cantidad de solicitudes procesadas por segundo se triplicó.
Esta lógica sigue el mismo camino que DeepSeek V3 y Qwen3: no impresionar con parámetros totales más grandes, sino usar activación dispersa para encontrar un equilibrio entre eficiencia y capacidad.
reasoning_effort: Activar la capacidad de razonamiento bajo demanda
Este es un aspecto bastante práctico del diseño del producto en esta ocasión.
Antes, había que elegir entre un modelo de respuesta rápida y un modelo de razonamiento lento, y a menudo era necesario implementar dos modelos diferentes para lograrlo. Small 4 agrega un parámetro que permite controlar directamente a nivel de solicitud de API: si se debe usar la capacidad de razonamiento en esta llamada y en qué medida.
Las preguntas simples reciben una respuesta rápida, las preguntas complejas pueden pensar más tiempo: el mismo modelo, la misma API, sin necesidad de cambiar. Este diseño ahorra mucho trabajo a los equipos de ingeniería.
Licencia de código abierto y canales de uso
Mistral continúa publicando bajo la licencia Apache 2.0, sin restricciones de uso comercial, permitiendo descargar los pesos directamente para autoimplementación.
Lugares actualmente disponibles:
- API de Mistral y AI Studio
- Hugging Face (descarga completa de pesos)
- NVIDIA build.nvidia.com (prueba gratuita de prototipo)
- Contenedor NVIDIA NIM (implementación en producción)
Apache 2.0 es la licencia más limpia para las empresas: sin preocupaciones por límites de uso, permite modificaciones y distribución sin problemas.
En el contexto de la tendencia de los modelos grandes de código abierto
En los últimos dos años, el panorama competitivo de los modelos grandes de código abierto ha cambiado muy rápidamente. DeepSeek V3 usó MoE combinado con entrenamiento de bajo costo para debilitar la protección de los modelos cerrados, Qwen3 de Alibaba expandió su alcance con la licencia Apache, y Llama 4 de Meta también lanzó su versión MoE en abril.
Small 4 de Mistral sigue un camino similar: 119B totales, 6,5B activados, licencia Apache, empaquetando razonamiento, multimodalidad y código en una sola unidad de implementación. Hace dos años, esta configuración solo existía en los mejores modelos cerrados; ahora se puede descargar gratuitamente.
Para los equipos que desean construir capacidades de IA propias en un entorno de producción, las opciones de modelos de código abierto están pasando de ser una "solución temporal" a una "consideración seria". Small 4 se suma a este grupo de opciones, y su valor principal es reducir la complejidad de la implementación: ya no es necesario mantener tres modelos simultáneamente, uno es suficiente.
Si es adecuado para su escenario, aún es necesario ejecutar benchmarks. Mistral afirma oficialmente que el soporte para chino no es tan bueno como para inglés; esto debe ser evaluado por separado por los equipos locales.
Fuente de referencia: CocoLoop, 119B Parameters, 6.5B Activated: Mistral Small 4 Collapses Three Open Models Into One (BaristaLabs Blog); Mistral AI Releases Mistral Small 4 (MarkTechPost)