Grok 4.20 usa multiagentes para reducir la tasa de alucinación del 12 % al 4,2 %

En febrero de este año, xAI presentó Grok 4.20 – no Grok 5, sino algo estructuralmente completamente diferente: cuatro agentes con roles distintos ejecutándose en el mismo modelo, cuestionándose y debatiendo entre sí para finalmente sintetizar una respuesta.

La idea suena un tanto esotérica, pero detrás hay un diseño de ingeniería concreto.

Cuatro roles, un cerebro

Primero, sobre la estructura: Grok 4.20 no son cuatro modelos independientes, sino una gran base MoE de aproximadamente 3 billones de parámetros, que activa unos 500 mil millones de parámetros por inferencia. Los cuatro agentes operan sobre esta base mediante capas de adaptación ligeras tipo LoRA – esencialmente cuatro "personalidades" del mismo modelo.

Los cuatro roles son:

  • Grok (líder): descomposición de tareas, estrategia general, salida final sintetizada
  • Harper (investigador): búsqueda en tiempo real y verificación de hechos, con fuerte integración al flujo de información de X
  • Benjamin (experto en lógica): razonamiento paso a paso, cálculos matemáticos, generación y validación de código
  • Lucas (opositor): especializado en encontrar fallos – identifica sesgos, cuestiona conclusiones, evita el exceso de confianza

Cada vez que se enfrenta a un problema suficientemente complejo, los cuatro agentes siguen un proceso: descomposición de tareas → análisis paralelo (caché KV compartido) → múltiples rondas de debate → síntesis final.

El debate no es una actuación; la existencia de Lucas es para romper el sesgo de confirmación que Grok y Benjamin podrían desarrollar.

La tasa de alucinación – una cifra impresionante

La tasa de alucinación cayó del 12 % en Grok 4.1 al 4,2 %, una reducción del 65 %.

El 4 % es bastante bajo entre los grandes modelos actuales; los modelos insignia de OpenAI y Anthropic se sitúan en el rango del 5–8 %.

Otros datos:

MétricaGrok 4.20
IFBench (cumplimiento de instrucciones)83 %, primer lugar
Velocidad de inferencia220,5 tokens/segundo
SWE-bench (programación)75 %
Índice de Inteligencia8.º lugar, puntuación 48
Ventana de contexto2 millones de tokens

En programación, el 75 % sigue por detrás del Claude Opus 4.6 con un 80,8 %. En el ranking general, 8.º lugar, mientras que GPT-5.4 obtiene 57 puntos – una brecha considerable. Por lo tanto, Grok 4.20 no es el número uno en "inteligencia", pero es competitivo en "confiabilidad de las respuestas".

Por qué una base compartida es mejor que múltiples modelos cooperando

Los marcos multiagente no fueron inventados por Grok 4.20 – LangGraph y AutoGen ya lo hacen desde hace tiempo. Pero el enfoque de xAI tiene una diferencia clave: en lugar de hacer cooperar a varios modelos independientes, ejecuta múltiples roles en la misma base.

Ventajas:

  • Caché KV compartido, latencia mucho menor
  • No es necesario transmitir grandes volúmenes de contexto entre modelos, reduciendo la pérdida de información
  • Todos los agentes tienen la misma comprensión fundamental de la misma entrada

En otras palabras, el "multiagente" anterior era como varias personas colaborando para resolver un problema; Grok 4.20 es como una persona con cuatro modos de pensamiento operando simultáneamente en la mente.

Infraestructura

El sistema se ejecuta en la supercomputadora Colossus de xAI en Memphis: más de 300.000 GPU, potencia de 2 gigavatios, ancho de banda de memoria de 194 PB/s. La ventana de contexto de 2 millones de tokens puede albergar una gran base de código más años de documentación.

Un detalle: xAI aún no ha revelado si el número de rondas de debate es fijo o adaptativo – esta parte de la ingeniería sigue siendo una caja negra.

Precios y acceso

  • API: entrada $2/M tokens, salida $6/M tokens
  • Usuarios comunes: suscripción SuperGrok (aproximadamente $30/mes) o X Premium+

El precio es más alto que el de Claude Opus 4.6 y ligeramente más bajo que el de GPT-5.4.

Esta dirección merece estudio

La fuerte caída en la tasa de alucinación demuestra que el mecanismo de "autocuestionamiento" de la IA es técnicamente efectivo. Esta podría ser una dirección de inversión más prometedora que simplemente aumentar parámetros.

Sin embargo, aún quedan algunas preguntas sin respuesta: ¿cuál es la lógica de control del número de rondas de debate? ¿Las críticas de Lucas llevan a un conservadurismo excesivo? xAI no ha divulgado estos detalles.

En cuanto a la arquitectura, lo que se sabe es que este es el primer producto comercial conocido que implementa un debate de cuatro agentes en una base unificada con caché KV compartido – si este enfoque se valida como efectivo, es solo cuestión de tiempo que otros grandes actores sigan el ejemplo.

Fuente de referencia: Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models (Medium, Engineer at Heart); CocoLoop, Grok 4.20 Beta Launch: 4-Agent AI System Launches (adwaitx.com); HOW THE XAI GROK 4.20 AGENTS WORK (NextBigFuture.com); Master the 5 Core Capabilities of Grok 4.20 (Apiyi.com)