Llama 4 adopta MoE por primera vez con Scout y Maverick

El 5 de abril del año pasado, Meta lanzó Llama 4, la primera vez que la serie Llama utiliza arquitectura MoE. Se presentaron dos modelos simultáneamente:

Llama 4 Scout

  • Parámetros activados: 17B / Parámetros totales: aproximadamente 109B
  • Número de expertos: 16
  • Ventana de contexto: 10 millones de tokens

Así es, 10 millones de tokens de contexto. Esta cifra rompió el récord entre los modelos de código abierto en ese momento.

Llama 4 Maverick

  • Parámetros activados: 17B / Parámetros totales: aproximadamente 400B
  • Número de expertos: 128
  • Ventana de contexto: 1 millón de tokens

128 expertos, con capas MoE y densas intercaladas — los expertos solo participan en el cálculo en la mitad de las capas.

Multimodalidad nativa

Ambos modelos logran multimodalidad nativa mediante early fusion — el texto y las imágenes no se combinan mediante adaptadores externos, sino que se procesan de forma nativa e integrada dentro del modelo. Los datos de entrenamiento superan los 30 billones de tokens y abarcan más de 200 idiomas.

Nivel de rendimiento

Maverick supera a GPT-4o y Gemini 2.0 en programación, razonamiento, multilingüismo, contexto largo y comprensión de imágenes, y también compite con DeepSeek V3.1, que es mucho más grande.

Scout está orientado al público general — admite cuantización de 4 y 8 bits y se ejecuta en una sola GPU.

También está Llama 4 Behemoth (288B parámetros activados), que fue anunciado pero no se publicó como código abierto — todavía estaba en entrenamiento en ese momento.

Un detalle: la propia Meta lo llama "open-weight" y no "open-source". Los pesos del modelo son públicos y se pueden ajustar, pero el código de entrenamiento completo y los conjuntos de datos no se publicaron.

Fuente de referencia: CocoLoop, blog oficial de Meta AI