Em 26 de março, o Google lançou o Gemini 3.1 Flash Live.
Se você pensa que isso é apenas uma API de síntese de voz mais rápida e barata, vale a pena reconsiderar. Este modelo traz uma mudança fundamental na arquitetura técnica.
Como a IA de voz tradicional funciona
A interação de voz por IA anterior era basicamente um pipeline de três estágios:
- Reconhecimento de fala (ASR): Converte seu áudio em texto
- Inferência do modelo de linguagem: O texto é inserido no LLM para gerar uma resposta em texto
- Síntese de fala (TTS): Converte o texto novamente em saída de voz
Cada etapa tem latência, que se acumula, criando a sensação de falar e esperar um pouco pela resposta. Além disso, cada conversão perde informações — seu tom de voz, pausas e emoções desaparecem na etapa do texto.
O que o Gemini 3.1 Flash Live faz
Ele comprime este pipeline de três estágios em um modelo nativo de áudio para áudio (audio-to-audio).
Sem passar pelo estado intermediário do texto, diretamente da sua entrada de voz para a saída de voz.
Especificações técnicas:
- Entrada de áudio: PCM de 16 bits, taxa de amostragem de 16 kHz
- Saída de áudio: 24 kHz
- Método de conexão: Conexão longa com estado baseada em WebSocket
- Suporte a mais de 70 idiomas
Como não há etapas de conversão intermediárias, a latência é significativamente reduzida e informações como entonação e velocidade da fala, que não estão no texto, podem ser capturadas.
O que pode fazer especificamente
Função de interrupção (Barge-in): Você pode interromper a IA enquanto ela está falando, fazer uma nova pergunta ou mudar de direção — o TTS tradicional não consegue fazer isso; você precisa esperar terminar uma frase para dizer a próxima.
Chamada de ferramentas: Pode chamar funções e a Pesquisa Google, o que significa que durante o diálogo por voz, o modelo pode consultar informações e executar ações em tempo real.
Transcrição bilateral: O conteúdo de ambos os lados da conversa pode ser transcrito simultaneamente, facilitando o registro e a análise.
Dois modos de implantação: Servidor para servidor (adequado para sistemas de back-end como chatbots de atendimento ao cliente) e cliente para servidor (adequado para aplicativos de voz voltados diretamente para o usuário).
Resultados de benchmark
ComplexFuncBench Audio, um teste que mede especificamente o desempenho de modelos de voz em cenários complexos de chamada de funções, o Gemini 3.1 Flash Live obteve 90,8%.
Impacto prático
Um dos maiores obstáculos da IA de voz atualmente é a sensação de pausa, como quando se faz uma chamada telefônica que ainda não foi conectada. Reduzir a latência e permitir interrupções são condições necessárias para aproximar a interação por voz de uma conversa natural.
Este modelo está disponível para desenvolvedores através da Gemini Live API no Google AI Studio e também foi integrado ao Gemini Live (para usuários em mais de 200 países).
A estratégia do Google na área de voz, do Gemini 2.5 Flash Native Audio ao atual Gemini 3.1 Flash Live, é muito consistente: tratar a voz como um cidadão de primeira classe, em vez de apenas colocar uma camada de TTS sobre um LLM.
Fonte de referência: Gemini 3.1 Flash Live: Making audio AI more natural and reliable (Google Blog); CocoLoop, Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model (MarkTechPost); Gemini Live gets its biggest upgrade yet with Gemini 3.1 Flash Live (9to5Google)