La empresa francesa de IA Mistral publicó el 6 de octubre una vista previa de investigación de Mistral Large 4. La compañía le puso el apodo de "le Chonk", que viene a significar algo así como "el grandote". Se trata de un modelo de mezcla de expertos (MoE) nativamente multimodal, con un billón de parámetros en total, de los cuales se activan unos 49.000 millones por token, con una ventana de contexto de 512K; admite entrada de texto e imagen y genera salida en texto.
La vista previa está disponible por ahora a través de la API de Mistral, dirigida primero a desarrolladores, responsables de ciberseguridad y organismos gubernamentales; la empresa planea ampliar el acceso más adelante este mes y publicar los pesos abiertos a finales de octubre.
Entrenamiento y posicionamiento
Según el blog oficial de Mistral, Large 4 se entrenó desde cero utilizando los propios centros de datos de la empresa en Europa, con unas 3.800 GPU Nvidia Grace Blackwell; CNBC informó que el ciclo de entrenamiento duró unos dos meses. Mistral señala como puntos fuertes la ciberseguridad, la programación, la manufactura, las finanzas y las tareas multimodales.
De cara al público, la empresa afirma que Large 4 es "el modelo de pesos abiertos más potente fuera de China, y por un margen amplio". CNBC también informa que Mistral reconoce seguir por detrás de los modelos cerrados más avanzados en áreas como la programación.
La API ofrece dos modos de razonamiento: none y high. El desarrollador Simon Willison, al probarlo, observó que el modo high genera en promedio menos tokens (2.717) que el modo none (3.275), y que además los resultados son mejores en modo high. Su valoración general es que Large 4 queda alrededor de medio año por detrás de la frontera.
Cómo lo puntúan terceros
El evaluador independiente Artificial Analysis le otorga 38 puntos en el Índice de Inteligencia. En comparación:
| Modelo | Índice de Inteligencia |
|---|---|
| DeepSeek V4.1 Flash | 39 |
| Mistral Large 4 | 38 |
| GPT-6 Luna (max) | 38 |
| Mistral Large 3 | 9 |
Hay una diferencia de 29 puntos entre ambas generaciones; la versión anterior, Large 3, con 9 puntos, queda claramente rezagada en esta lista. Por eso Artificial Analysis lo califica como "el modelo más inteligente fuera de Estados Unidos y China". En el índice de ciberseguridad de esta firma, Large 4 obtiene 50 puntos, pero en la prueba de razonamiento documental (GDP.pdf) la tasa de aciertos es de solo el 19%, un punto claramente débil.
Echando cuentas
El precio de la API en la vista previa es de 1,36 dólares por millón de tokens de entrada y 4,18 dólares por millón de tokens de salida, con 0,14 dólares por millón en tokens de entrada que coinciden con la caché; hay un 50% de descuento durante las dos primeras semanas. Artificial Analysis lo convierte según su propio conjunto de tareas y obtiene un costo de 1,13 dólares por tarea, o 0,57 dólares durante el periodo de descuento.
Un cálculo rápido de un escenario habitual: introducir 1 millón de tokens de código o documentos y obtener 200.000 tokens de salida cuesta, a precio completo, unos 2,2 dólares, y en el periodo de descuento, unos 1,1 dólares. El precio de la salida es unas tres veces el de la entrada, así que las tareas de agentes con salidas largas resultan más caras.
La proporción de activación también se puede calcular: 49.000 millones de parámetros activados sobre un total de un billón da aproximadamente 4,9%, cerca del Reflection Beam, publicado un día antes (23.000 millones activados sobre 501.000 millones en total, alrededor de 4,6%). Como el costo de inferencia depende sobre todo de los parámetros activados, ambas empresas insisten en hablar de "eficiencia".
El umbral para desplegarlo es otro asunto. Calculado a precisión de 8 bits, solo almacenar los pesos de un billón de parámetros requiere alrededor de 1 TB de VRAM; con cuantización de 4 bits, baja a unos 500 GB. Tras obtener los pesos abiertos, la mayoría de los equipos probablemente seguirá dependiendo de alojamiento en la nube o esperará a versiones destiladas de la comunidad.
La carta de Europa
Mistral acaba de cerrar en septiembre una ronda de financiación de 3.000 millones de euros, liderada por Samsung. Large 4 es el primer modelo insignia desde que llegó ese dinero; la empresa repite una y otra vez los puntos de capacidad de cómputo propia y entrenamiento en suelo europeo, y a juzgar por el enfoque de su comunicación, el objetivo son las compras de gobiernos europeos y sectores regulados.
Mistral todavía no ha anunciado los términos de licencia de los pesos abiertos ni la fecha exacta de publicación. Por ahora, todas las puntuaciones proceden solo de datos oficiales y de unas pocas evaluadoras independientes; cuánto pueda reproducir la comunidad una vez tenga los pesos no se sabrá hasta finales de mes.
Fuentes: blog oficial de Mistral, Artificial Analysis, CocoLoop, CNBC, blog de Simon Willison; el Índice de Inteligencia y el costo por tarea según los datos publicados por Artificial Analysis, los precios de la API según la tabla de la vista previa de Mistral, y la estimación de VRAM es un cálculo aproximado según el número de parámetros.