Llama 4 adopte pour la première fois le MoE avec Scout et Maverick

Le 5 avril de l'année dernière, Meta a publié Llama 4, la première fois que la série Llama utilise une architecture MoE. Deux modèles ont été lancés simultanément :

Llama 4 Scout

  • Paramètres activés : 17B / Paramètres totaux : environ 109B
  • Nombre d'experts : 16
  • Fenêtre de contexte : 10 millions de tokens

Oui, 10 millions de tokens de contexte. Ce chiffre a immédiatement battu le record des modèles open source à l'époque.

Llama 4 Maverick

  • Paramètres activés : 17B / Paramètres totaux : environ 400B
  • Nombre d'experts : 128
  • Fenêtre de contexte : 1 million de tokens

128 experts, avec des couches MoE et denses alternées — les experts ne participent au calcul que dans la moitié des couches.

Multimodalité native

Les deux modèles atteignent une multimodalité native grâce à l'early fusion — le texte et les images ne sont pas assemblés par des adaptateurs externes, mais traités de manière native et fusionnée à l'intérieur du modèle. Les données d'entraînement dépassent les 30 billions de tokens et couvrent plus de 200 langues.

Niveau de performance

Maverick surpasse GPT-4o et Gemini 2.0 en programmation, raisonnement, multilinguisme, contexte long et compréhension d'images, et peut également rivaliser avec DeepSeek V3.1, pourtant bien plus volumineux.

Scout est orienté vers le grand public — il prend en charge la quantification 4 bits et 8 bits et fonctionne sur une seule carte graphique.

Il existe aussi Llama 4 Behemoth (288B paramètres activés), qui a été annoncé mais n'a pas été open source — il était encore en cours d'entraînement à l'époque.

Un détail : Meta elle-même qualifie cela d'"open-weight" et non d'"open source". Les poids du modèle sont publics et peuvent être affinés, mais le code d'entraînement complet et les ensembles de données n'ont pas été publiés.

Source de référence : CocoLoop, blog officiel de Meta AI