Novo modelo de voz do Grok supera Gemini em 30 pontos percentuais em benchmark

O ranking público τ-voice Bench, no último ano, foi uma disputa entre Gemini 3.1 Flash Live e GPT Realtime. Em 25 de abril, a xAI lançou um novo modelo e atingiu diretamente 67,3%.

O próximo colocado, Gemini 3.1 Flash Live: 43,8%.

Essa diferença de 23,5 pontos percentuais em um benchmark de LLM não é chamada de "liderança", mas de "outra magnitude".

O mais notável não é a pontuação. É que este modelo já está realmente em uso no sistema de atendimento ao cliente da Starlink.

grok-voice-think-fast-1.0: Primeiro, alguns números

O modelo se chama grok-voice-think-fast-1.0, posicionado oficialmente como um "agente de voz full-duplex". Full-duplex significa que ele não precisa esperar você terminar de falar para responder, podendo ouvir e falar simultaneamente, como uma conversa normal entre duas pessoas.

Pontuações do τ-voice Bench por setor vertical:

Setorgrok-voice-think-fast-1.0Segundo colocado
Varejo62,3%45,6%
Aviação66,0%64,0%
Telecomunicações73,7%40,4%

A diferença no setor de telecomunicações é a mais absurda. 73,7% contra 40,4%, quase o dobro. Isso não é resultado de empilhamento de parâmetros, mas sim de treinamento extensivo e específico da xAI em cenários típicos de atendimento ao cliente, como eletrônicos/contas.

Suporta mais de 25 idiomas, mantendo-se estável em ambientes ruidosos, com sotaques e interrupções.

Como seu "pensar" não trava

O ponto técnico mais interessante é chamado de background reasoning – raciocínio em segundo plano.

Agentes de voz comuns, ao encontrar solicitações complexas, têm dois comportamentos típicos: ou dão uma resposta superficial (você sente que estão enrolando) ou ficam em silêncio por alguns segundos para pensar (você sente que estão travando). Nenhuma das duas experiências parece uma conversa com uma pessoa real.

A abordagem do grok-voice-think-fast-1.0 é: enquanto responde a você, ele realiza raciocínio em paralelo em segundo plano. Na superfície, um modelo de diálogo de baixa latência mantém a fluência – "hum", "sim", "entendo", "deixe-me ver" – esses preenchimentos naturais de conversa. Por trás, outra passagem de raciocínio resolve o problema real que você apresentou. Quando a passagem de raciocínio produz um resultado, ele é imediatamente conectado ao fluxo principal do diálogo.

Declaração oficial da xAI:

"Pensar em segundo plano – processar consultas e fluxos de trabalho complexos, com impacto zero na latência de resposta."

Parece jargão de marketing, mas o próprio cenário de telecomunicações do τ-voice Bench testa exatamente isso: o usuário diz uma longa sequência de números de conta, informações de assinatura, mudanças de endereço, e o modelo não pode pausar por mais de 200 milissegundos. A pontuação de 73,7% do grok-voice-think-fast-1.0 neste cenário é a evidência empírica de que esse mecanismo funciona.

Starlink entrega todo o atendimento ao cliente a ele: Um conjunto de números reais

Benchmarks teóricos não são interessantes. O que chama a atenção são os dados de implantação da Starlink.

A Starlink conectou este agente de voz em linhas telefônicas reais de vendas e atendimento ao cliente. Após um período de operação, a xAI divulgou vários KPIs:

Taxa de conversão de vendas de 20%. De cada cinco pessoas que ligaram para consultar, uma pagou para ativar o serviço Starlink durante a chamada.

O que isso significa? No setor tradicional de telemarketing, um vendedor de linha de frente, após treinamento especializado e coaching de argumentação, tem uma taxa média de conversão call-to-sale de 5-8%, já considerada excelente. 20% é o nível dos melhores vendedores humanos, e é muito difícil de manter consistentemente – pessoas cansam, ficam emocionais, têm dias ruins.

A IA não.

70% das solicitações de atendimento ao cliente são resolvidas de forma totalmente autônoma, sem intervenção humana.

Este dado é ainda mais marcante. Significa que, de cada 10 chamadas de clientes, 7 são resolvidas pelo próprio agente, o problema é tratado antes do desligamento – consultas de fatura, alterações de plano, solução de problemas técnicos básicos, alteração de endereço, desconexão e reconexão, tudo feito de ponta a ponta, sem transferência para um humano.

Os 30% restantes seguem para um processo de escalonamento para um atendente humano, mas antes disso, o agente de voz já empacotou o problema do cliente, o contexto da conta e as soluções testadas – o atendente humano, ao receber, pode lidar diretamente, sem precisar perguntar "Qual é o seu número de conta? O que você já tentou?"

Um único agente opera simultaneamente 28 ferramentas internas diferentes.

Este é o ponto mais digno de nota. O termo "agente" foi muito usado no ano passado, mas poucos realmente conseguem orquestrar dezenas de ferramentas em um ambiente de produção. Nesta implantação da Starlink, um único fluxo de diálogo pode envolver: sistema de contas, sistema de faturamento, consulta de status do dispositivo, mapa de cobertura, rastreamento logístico, processo de reembolso, tickets técnicos, agendamento de serviço de campo, registro de relacionamento com o cliente... Uma chamada de 5 a 10 minutos pode significar que o agente acessou ferramentas 15 vezes.

Por que a Starlink usou primeiro

Não é coincidência.

xAI e Starlink estão ambos no ecossistema da SpaceX. No mês passado, Musk fundiu a SpaceX e a xAI para solicitar um IPO (avaliação de US$ 1,75 trilhão, o maior da história). Essa sinergia interna de "usar primeiro o próprio produto" é muito mais rápida do que vender para a Salesforce ou a Microsoft. A Starlink se atreve a conectar linhas telefônicas críticas para vendas a um novo modelo porque, se houver um problema, Musk pode enviar um SMS para corrigi-lo.

Esse ciclo fechado interno também é uma mina de ouro para o treinamento do modelo. O volume diário de chamadas de atendimento ao cliente da Starlink está na casa dos milhões, tudo retornando para a xAI como dados de treinamento RLHF. Empresas comuns de IA de voz levariam anos para conseguir dados de cenários reais nessa escala, assinando contratos com clientes e lidando com conformidade. A xAI pegou um atalho.

O que isso mudou

Primeiro, a liderança no mercado de IA de voz foi reordenada.

Antes, os principais players no segmento de agentes de voz eram OpenAI Realtime, Google Gemini Flash Live, ElevenLabs, Vapi, Bland, etc. A diferença no τ-voice Bench desta vez não é de 1-2 pontos, é uma lacuna. No curto prazo, Gemini e OpenAI terão que voltar à estaca zero para complementar suas capacidades.

Segundo, os pesos de decisão dos compradores B2B mudaram.

Antes, as empresas escolhiam fornecedores de voz principalmente com base em dois fatores: latência e qualidade de voz. Agora, a terceira dimensão se torna "se o ciclo pode ser fechado de ponta a ponta". A taxa de resolução autônoma de 70% da Starlink tornou esse padrão claro – agentes de voz que podem fechar o ciclo e os que não podem devem estar em duas faixas de preço diferentes.

Terceiro, o teto da experiência do usuário B2C foi elevado.

20% de conversão de vendas, 70% de resolução autônoma, operação de 28 ferramentas, 25 idiomas, pensamento sem latência. Um ano atrás, esses indicadores eram o "limite teórico" no mundo da IA de voz; agora, são "dados medidos em produção". Todas as empresas que usam agentes de voz para atendimento ao cliente agora precisam repensar sua linha de base.

Quanto ao que Anthropic e OpenAI farão em seguida, não deve demorar muito. Ambos têm capacidades de voz, mas ainda não apresentaram um caso de implantação na escala de "assumir todas as linhas de atendimento ao cliente de uma subsidiária da SpaceX". A curva do τ-voice Bench na próxima atualização será muito movimentada.

Fontes de referência: Grok Voice Think Fast 1.0 (anúncio oficial da xAI), CocoLoop, xAI Launches grok-voice-think-fast-1.0: Topping τ-voice Bench at 67.3% (MarkTechPost), xAI launches Grok Voice Think Fast 1.0 for voice agents (Testing Catalog), xAI Unveils Grok Voice AI That Thinks In Real Time While Handling Customer Support At Scale (Metaverse Post)