El 5 de abril del año pasado, Meta lanzó Llama 4, la primera vez que la serie Llama utiliza arquitectura MoE. Se presentaron dos modelos simultáneamente:
Llama 4 Scout
- Parámetros activados: 17B / Parámetros totales: aproximadamente 109B
- Número de expertos: 16
- Ventana de contexto: 10 millones de tokens
Así es, 10 millones de tokens de contexto. Esta cifra rompió el récord entre los modelos de código abierto en ese momento.
Llama 4 Maverick
- Parámetros activados: 17B / Parámetros totales: aproximadamente 400B
- Número de expertos: 128
- Ventana de contexto: 1 millón de tokens
128 expertos, con capas MoE y densas intercaladas — los expertos solo participan en el cálculo en la mitad de las capas.
Multimodalidad nativa
Ambos modelos logran multimodalidad nativa mediante early fusion — el texto y las imágenes no se combinan mediante adaptadores externos, sino que se procesan de forma nativa e integrada dentro del modelo. Los datos de entrenamiento superan los 30 billones de tokens y abarcan más de 200 idiomas.
Nivel de rendimiento
Maverick supera a GPT-4o y Gemini 2.0 en programación, razonamiento, multilingüismo, contexto largo y comprensión de imágenes, y también compite con DeepSeek V3.1, que es mucho más grande.
Scout está orientado al público general — admite cuantización de 4 y 8 bits y se ejecuta en una sola GPU.
También está Llama 4 Behemoth (288B parámetros activados), que fue anunciado pero no se publicó como código abierto — todavía estaba en entrenamiento en ese momento.
Un detalle: la propia Meta lo llama "open-weight" y no "open-source". Los pesos del modelo son públicos y se pueden ajustar, pero el código de entrenamiento completo y los conjuntos de datos no se publicaron.
Fuente de referencia: CocoLoop, blog oficial de Meta AI