Grok 4.20 usa multiagentes para reduzir taxa de alucinação de 12% para 4,2%

Em fevereiro deste ano, a xAI lançou o Grok 4.20 – não o Grok 5, mas algo estruturalmente completamente diferente: quatro agentes com papéis distintos rodando no mesmo modelo, questionando e debatendo entre si para, no final, sintetizar uma resposta.

A ideia parece um tanto esotérica, mas por trás dela há um projeto de engenharia concreto.

Quatro papéis, um cérebro

Primeiro, sobre a estrutura: o Grok 4.20 não são quatro modelos independentes, mas sim uma grande base MoE com cerca de 3 trilhões de parâmetros, ativando aproximadamente 500 bilhões de parâmetros por inferência. Os quatro agentes operam nessa base por meio de camadas de adaptação leves no estilo LoRA – essencialmente quatro "personalidades" do mesmo modelo.

Os quatro papéis são:

  • Grok (líder): decomposição de tarefas, estratégia geral, saída final sintetizada
  • Harper (pesquisador): busca em tempo real e verificação de fatos, com forte integração ao fluxo de informações do X
  • Benjamin (especialista em lógica): raciocínio passo a passo, cálculos matemáticos, geração e validação de código
  • Lucas (opositor): especializado em encontrar falhas – identifica vieses, questiona conclusões, evita excesso de confiança

Sempre que encontra um problema suficientemente complexo, os quatro agentes seguem um processo: decomposição de tarefas → análise paralela (cache KV compartilhado) → múltiplas rodadas de debate → síntese final.

O debate não é uma encenação; a existência de Lucas é para quebrar o viés de confirmação que Grok e Benjamin possam desenvolver.

A taxa de alucinação – um número impressionante

A taxa de alucinação caiu de 12% no Grok 4.1 para 4,2%, uma redução de 65%.

4% é bastante baixo entre os grandes modelos atuais; os modelos principais da OpenAI e Anthropic ficam na faixa de 5–8%.

Outros dados:

MétricaGrok 4.20
IFBench (conformidade com instruções)83%, primeiro lugar
Velocidade de inferência220,5 tokens/segundo
SWE-bench (programação)75%
Índice de Inteligência8º lugar, pontuação 48
Janela de contexto2 milhões de tokens

Em programação, 75% ainda fica atrás do Claude Opus 4.6 com 80,8%. No ranking geral, 8º lugar, enquanto o GPT-5.4 tem 57 pontos – uma diferença considerável. Portanto, o Grok 4.20 não é o número um em "inteligência", mas é competitivo em "confiabilidade das respostas".

Por que uma base compartilhada é melhor que múltiplos modelos cooperando

Estruturas multiagentes não foram inventadas pelo Grok 4.20 – LangGraph e AutoGen já fazem isso há muito tempo. Mas a abordagem da xAI tem uma diferença crucial: em vez de fazer vários modelos independentes cooperarem, ela executa vários papéis na mesma base.

Benefícios:

  • Cache KV compartilhado, latência muito menor
  • Não é necessário transmitir grandes volumes de contexto entre modelos, reduzindo perda de informação
  • Todos os agentes têm a mesma compreensão fundamental da mesma entrada

Em outras palavras, o "multiagente" anterior era como várias pessoas colaborando para resolver um problema; o Grok 4.20 é como uma pessoa com quatro modos de pensamento operando simultaneamente na mente.

Infraestrutura

O sistema roda no supercomputador Colossus da xAI em Memphis: mais de 300.000 GPUs, potência de 2 gigawatts, largura de banda de memória de 194 PB/s. A janela de contexto de 2 milhões de tokens pode conter uma grande base de código mais anos de documentação.

Um detalhe: a xAI ainda não divulgou se o número de rodadas de debate é fixo ou adaptativo – essa parte da engenharia continua sendo uma caixa-preta.

Precificação e acesso

  • API: entrada $2/M tokens, saída $6/M tokens
  • Usuários comuns: assinatura SuperGrok (cerca de $30/mês) ou X Premium+

O preço é mais alto que o do Claude Opus 4.6 e um pouco mais baixo que o do GPT-5.4.

Essa direção merece estudo

A queda acentuada na taxa de alucinação mostra que o mecanismo de "autocuestinamento" da IA é tecnicamente eficaz. Esta pode ser uma direção de investimento mais promissora do que simplesmente aumentar parâmetros.

No entanto, ainda há algumas questões não resolvidas: qual é a lógica de controle do número de rodadas de debate? As críticas de Lucas levam a um conservadorismo excessivo? A xAI não divulgou essas informações.

Em termos de arquitetura, o que se sabe é que este é o primeiro produto comercial conhecido a implementar um debate de quatro agentes em uma base unificada com cache KV compartilhado – se essa abordagem for validada como eficaz, é apenas uma questão de tempo até que outras grandes empresas sigam o exemplo.

Fonte de referência: Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models (Medium, Engineer at Heart); CocoLoop, Grok 4.20 Beta Launch: 4-Agent AI System Launches (adwaitx.com); HOW THE XAI GROK 4.20 AGENTS WORK (NextBigFuture.com); Master the 5 Core Capabilities of Grok 4.20 (Apiyi.com)