Em fevereiro deste ano, a xAI lançou o Grok 4.20 – não o Grok 5, mas algo estruturalmente completamente diferente: quatro agentes com papéis distintos rodando no mesmo modelo, questionando e debatendo entre si para, no final, sintetizar uma resposta.
A ideia parece um tanto esotérica, mas por trás dela há um projeto de engenharia concreto.
Quatro papéis, um cérebro
Primeiro, sobre a estrutura: o Grok 4.20 não são quatro modelos independentes, mas sim uma grande base MoE com cerca de 3 trilhões de parâmetros, ativando aproximadamente 500 bilhões de parâmetros por inferência. Os quatro agentes operam nessa base por meio de camadas de adaptação leves no estilo LoRA – essencialmente quatro "personalidades" do mesmo modelo.
Os quatro papéis são:
- Grok (líder): decomposição de tarefas, estratégia geral, saída final sintetizada
- Harper (pesquisador): busca em tempo real e verificação de fatos, com forte integração ao fluxo de informações do X
- Benjamin (especialista em lógica): raciocínio passo a passo, cálculos matemáticos, geração e validação de código
- Lucas (opositor): especializado em encontrar falhas – identifica vieses, questiona conclusões, evita excesso de confiança
Sempre que encontra um problema suficientemente complexo, os quatro agentes seguem um processo: decomposição de tarefas → análise paralela (cache KV compartilhado) → múltiplas rodadas de debate → síntese final.
O debate não é uma encenação; a existência de Lucas é para quebrar o viés de confirmação que Grok e Benjamin possam desenvolver.
A taxa de alucinação – um número impressionante
A taxa de alucinação caiu de 12% no Grok 4.1 para 4,2%, uma redução de 65%.
4% é bastante baixo entre os grandes modelos atuais; os modelos principais da OpenAI e Anthropic ficam na faixa de 5–8%.
Outros dados:
| Métrica | Grok 4.20 |
|---|---|
| IFBench (conformidade com instruções) | 83%, primeiro lugar |
| Velocidade de inferência | 220,5 tokens/segundo |
| SWE-bench (programação) | 75% |
| Índice de Inteligência | 8º lugar, pontuação 48 |
| Janela de contexto | 2 milhões de tokens |
Em programação, 75% ainda fica atrás do Claude Opus 4.6 com 80,8%. No ranking geral, 8º lugar, enquanto o GPT-5.4 tem 57 pontos – uma diferença considerável. Portanto, o Grok 4.20 não é o número um em "inteligência", mas é competitivo em "confiabilidade das respostas".
Por que uma base compartilhada é melhor que múltiplos modelos cooperando
Estruturas multiagentes não foram inventadas pelo Grok 4.20 – LangGraph e AutoGen já fazem isso há muito tempo. Mas a abordagem da xAI tem uma diferença crucial: em vez de fazer vários modelos independentes cooperarem, ela executa vários papéis na mesma base.
Benefícios:
- Cache KV compartilhado, latência muito menor
- Não é necessário transmitir grandes volumes de contexto entre modelos, reduzindo perda de informação
- Todos os agentes têm a mesma compreensão fundamental da mesma entrada
Em outras palavras, o "multiagente" anterior era como várias pessoas colaborando para resolver um problema; o Grok 4.20 é como uma pessoa com quatro modos de pensamento operando simultaneamente na mente.
Infraestrutura
O sistema roda no supercomputador Colossus da xAI em Memphis: mais de 300.000 GPUs, potência de 2 gigawatts, largura de banda de memória de 194 PB/s. A janela de contexto de 2 milhões de tokens pode conter uma grande base de código mais anos de documentação.
Um detalhe: a xAI ainda não divulgou se o número de rodadas de debate é fixo ou adaptativo – essa parte da engenharia continua sendo uma caixa-preta.
Precificação e acesso
- API: entrada $2/M tokens, saída $6/M tokens
- Usuários comuns: assinatura SuperGrok (cerca de $30/mês) ou X Premium+
O preço é mais alto que o do Claude Opus 4.6 e um pouco mais baixo que o do GPT-5.4.
Essa direção merece estudo
A queda acentuada na taxa de alucinação mostra que o mecanismo de "autocuestinamento" da IA é tecnicamente eficaz. Esta pode ser uma direção de investimento mais promissora do que simplesmente aumentar parâmetros.
No entanto, ainda há algumas questões não resolvidas: qual é a lógica de controle do número de rodadas de debate? As críticas de Lucas levam a um conservadorismo excessivo? A xAI não divulgou essas informações.
Em termos de arquitetura, o que se sabe é que este é o primeiro produto comercial conhecido a implementar um debate de quatro agentes em uma base unificada com cache KV compartilhado – se essa abordagem for validada como eficaz, é apenas uma questão de tempo até que outras grandes empresas sigam o exemplo.
Fonte de referência: Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models (Medium, Engineer at Heart); CocoLoop, Grok 4.20 Beta Launch: 4-Agent AI System Launches (adwaitx.com); HOW THE XAI GROK 4.20 AGENTS WORK (NextBigFuture.com); Master the 5 Core Capabilities of Grok 4.20 (Apiyi.com)