Le 5 avril de l'année dernière, Meta a publié Llama 4, la première fois que la série Llama utilise une architecture MoE. Deux modèles ont été lancés simultanément :
Llama 4 Scout
- Paramètres activés : 17B / Paramètres totaux : environ 109B
- Nombre d'experts : 16
- Fenêtre de contexte : 10 millions de tokens
Oui, 10 millions de tokens de contexte. Ce chiffre a immédiatement battu le record des modèles open source à l'époque.
Llama 4 Maverick
- Paramètres activés : 17B / Paramètres totaux : environ 400B
- Nombre d'experts : 128
- Fenêtre de contexte : 1 million de tokens
128 experts, avec des couches MoE et denses alternées — les experts ne participent au calcul que dans la moitié des couches.
Multimodalité native
Les deux modèles atteignent une multimodalité native grâce à l'early fusion — le texte et les images ne sont pas assemblés par des adaptateurs externes, mais traités de manière native et fusionnée à l'intérieur du modèle. Les données d'entraînement dépassent les 30 billions de tokens et couvrent plus de 200 langues.
Niveau de performance
Maverick surpasse GPT-4o et Gemini 2.0 en programmation, raisonnement, multilinguisme, contexte long et compréhension d'images, et peut également rivaliser avec DeepSeek V3.1, pourtant bien plus volumineux.
Scout est orienté vers le grand public — il prend en charge la quantification 4 bits et 8 bits et fonctionne sur une seule carte graphique.
Il existe aussi Llama 4 Behemoth (288B paramètres activés), qui a été annoncé mais n'a pas été open source — il était encore en cours d'entraînement à l'époque.
Un détail : Meta elle-même qualifie cela d'"open-weight" et non d'"open source". Les poids du modèle sont publics et peuvent être affinés, mais le code d'entraînement complet et les ensembles de données n'ont pas été publiés.
Source de référence : CocoLoop, blog officiel de Meta AI