Google reformula IA de voz e lança Gemini 3.1 Flash Live

Em 26 de março, o Google lançou o Gemini 3.1 Flash Live.

Se você pensa que isso é apenas uma API de síntese de voz mais rápida e barata, vale a pena reconsiderar. Este modelo traz uma mudança fundamental na arquitetura técnica.

Como a IA de voz tradicional funciona

A interação de voz por IA anterior era basicamente um pipeline de três estágios:

  1. Reconhecimento de fala (ASR): Converte seu áudio em texto
  2. Inferência do modelo de linguagem: O texto é inserido no LLM para gerar uma resposta em texto
  3. Síntese de fala (TTS): Converte o texto novamente em saída de voz

Cada etapa tem latência, que se acumula, criando a sensação de falar e esperar um pouco pela resposta. Além disso, cada conversão perde informações — seu tom de voz, pausas e emoções desaparecem na etapa do texto.

O que o Gemini 3.1 Flash Live faz

Ele comprime este pipeline de três estágios em um modelo nativo de áudio para áudio (audio-to-audio).

Sem passar pelo estado intermediário do texto, diretamente da sua entrada de voz para a saída de voz.

Especificações técnicas:

  • Entrada de áudio: PCM de 16 bits, taxa de amostragem de 16 kHz
  • Saída de áudio: 24 kHz
  • Método de conexão: Conexão longa com estado baseada em WebSocket
  • Suporte a mais de 70 idiomas

Como não há etapas de conversão intermediárias, a latência é significativamente reduzida e informações como entonação e velocidade da fala, que não estão no texto, podem ser capturadas.

O que pode fazer especificamente

Função de interrupção (Barge-in): Você pode interromper a IA enquanto ela está falando, fazer uma nova pergunta ou mudar de direção — o TTS tradicional não consegue fazer isso; você precisa esperar terminar uma frase para dizer a próxima.

Chamada de ferramentas: Pode chamar funções e a Pesquisa Google, o que significa que durante o diálogo por voz, o modelo pode consultar informações e executar ações em tempo real.

Transcrição bilateral: O conteúdo de ambos os lados da conversa pode ser transcrito simultaneamente, facilitando o registro e a análise.

Dois modos de implantação: Servidor para servidor (adequado para sistemas de back-end como chatbots de atendimento ao cliente) e cliente para servidor (adequado para aplicativos de voz voltados diretamente para o usuário).

Resultados de benchmark

ComplexFuncBench Audio, um teste que mede especificamente o desempenho de modelos de voz em cenários complexos de chamada de funções, o Gemini 3.1 Flash Live obteve 90,8%.

Impacto prático

Um dos maiores obstáculos da IA de voz atualmente é a sensação de pausa, como quando se faz uma chamada telefônica que ainda não foi conectada. Reduzir a latência e permitir interrupções são condições necessárias para aproximar a interação por voz de uma conversa natural.

Este modelo está disponível para desenvolvedores através da Gemini Live API no Google AI Studio e também foi integrado ao Gemini Live (para usuários em mais de 200 países).

A estratégia do Google na área de voz, do Gemini 2.5 Flash Native Audio ao atual Gemini 3.1 Flash Live, é muito consistente: tratar a voz como um cidadão de primeira classe, em vez de apenas colocar uma camada de TTS sobre um LLM.

Fonte de referência: Gemini 3.1 Flash Live: Making audio AI more natural and reliable (Google Blog); CocoLoop, Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model (MarkTechPost); Gemini Live gets its biggest upgrade yet with Gemini 3.1 Flash Live (9to5Google)