En février dernier, xAI a lancé Grok 4.20 – pas Grok 5, mais quelque chose de structurellement complètement différent : quatre agents avec des rôles distincts fonctionnant dans le même modèle, se questionnant et débattant entre eux pour finalement synthétiser une réponse.
L'idée semble un peu ésotérique, mais derrière elle se trouve une conception technique concrète.
Quatre rôles, un cerveau
D'abord, la structure : Grok 4.20 n'est pas quatre modèles indépendants, mais une grande base MoE d'environ 3 billions de paramètres, activant environ 500 milliards de paramètres par inférence. Les quatre agents fonctionnent sur cette base via des couches d'adaptation légères de type LoRA – essentiellement quatre « personnalités » du même modèle.
Les quatre rôles sont :
- Grok (chef d'équipe) : décomposition des tâches, stratégie globale, sortie finale synthétisée
- Harper (chercheur) : recherche en temps réel et vérification des faits, forte intégration au flux d'informations de X
- Benjamin (expert en logique) : raisonnement pas à pas, calculs mathématiques, génération et validation de code
- Lucas (opposant) : spécialisé dans la recherche de failles – identifie les biais, remet en question les conclusions, évite l'excès de confiance
Chaque fois qu'il rencontre un problème suffisamment complexe, les quatre agents suivent un processus : décomposition des tâches → analyse parallèle (cache KV partagé) → plusieurs tours de débat → synthèse finale.
Le débat n'est pas une mise en scène ; l'existence de Lucas est destinée à briser le biais de confirmation que Grok et Benjamin pourraient développer.
Le taux d'hallucination – un chiffre impressionnant
Le taux d'hallucination est passé de 12 % pour Grok 4.1 à 4,2 %, soit une réduction de 65 %.
4 % est assez bas parmi les grands modèles actuels ; les modèles phares d'OpenAI et d'Anthropic se situent entre 5 et 8 %.
Autres données :
| Métrique | Grok 4.20 |
|---|---|
| IFBench (respect des instructions) | 83 %, première place |
| Vitesse d'inférence | 220,5 tokens/seconde |
| SWE-bench (programmation) | 75 % |
| Indice d'intelligence | 8e place, score 48 |
| Fenêtre de contexte | 2 millions de tokens |
En programmation, 75 % reste derrière Claude Opus 4.6 avec 80,8 %. Au classement général, 8e place, tandis que GPT-5.4 obtient 57 points – un écart considérable. Grok 4.20 n'est donc pas numéro un en « intelligence », mais il est compétitif en « fiabilité des réponses ».
Pourquoi une base partagée est meilleure que plusieurs modèles coopérant
Les frameworks multi-agents n'ont pas été inventés par Grok 4.20 – LangGraph et AutoGen existent depuis longtemps. Mais l'approche de xAI a une différence clé : au lieu de faire coopérer plusieurs modèles indépendants, elle exécute plusieurs rôles sur la même base.
Avantages :
- Cache KV partagé, latence bien plus faible
- Pas besoin de transmettre de grands volumes de contexte entre les modèles, réduisant la perte d'information
- Tous les agents ont la même compréhension fondamentale de la même entrée
En d'autres termes, le « multi-agents » précédent ressemblait à plusieurs personnes collaborant pour résoudre un problème ; Grok 4.20 est comme une personne avec quatre modes de pensée fonctionnant simultanément dans son esprit.
Infrastructure
Le système fonctionne sur le supercalculateur Colossus de xAI à Memphis : plus de 300 000 GPU, puissance de 2 gigawatts, bande passante mémoire de 194 Po/s. La fenêtre de contexte de 2 millions de tokens peut contenir une grande base de code plus des années de documentation.
Un détail : xAI n'a pas encore divulgué si le nombre de tours de débat est fixe ou adaptatif – cette partie technique reste une boîte noire.
Tarification et accès
- API : entrée 2 $/M tokens, sortie 6 $/M tokens
- Utilisateurs classiques : abonnement SuperGrok (environ 30 $/mois) ou X Premium+
Le prix est plus élevé que celui de Claude Opus 4.6 et légèrement inférieur à celui de GPT-5.4.
Cette direction mérite d'être étudiée
La forte baisse du taux d'hallucination montre que le mécanisme d'« auto-questionnement » de l'IA est techniquement efficace. Cela pourrait être une direction d'investissement plus prometteuse que la simple augmentation des paramètres.
Cependant, plusieurs questions restent sans réponse : quelle est la logique de contrôle du nombre de tours de débat ? Les critiques de Lucas conduisent-elles à un conservatisme excessif ? xAI n'a pas divulgué ces informations.
Sur le plan architectural, ce qui est connu est qu'il s'agit du premier produit commercial connu à mettre en œuvre un débat à quatre agents sur une base unifiée avec cache KV partagé – si cette approche s'avère efficace, il ne s'agit que d'une question de temps avant que d'autres grands acteurs ne suivent.
Source de référence : Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models (Medium, Engineer at Heart) ; CocoLoop, Grok 4.20 Beta Launch: 4-Agent AI System Launches (adwaitx.com) ; HOW THE XAI GROK 4.20 AGENTS WORK (NextBigFuture.com) ; Master the 5 Core Capabilities of Grok 4.20 (Apiyi.com)