Google refond son IA vocale et lance Gemini 3.1 Flash Live

Le 26 mars, Google a publié Gemini 3.1 Flash Live.

Si vous pensez qu'il s'agit simplement d'une API de synthèse vocale plus rapide et moins chère, il vaut la peine d'y regarder de plus près. Ce modèle apporte un changement fondamental dans l'architecture technique.

Comment fonctionne l'IA vocale traditionnelle

L'interaction vocale par IA précédente était essentiellement un pipeline en trois étapes :

  1. Reconnaissance vocale (ASR) : Convertit votre audio en texte
  2. Inférence du modèle de langage : Le texte est saisi dans le LLM pour générer une réponse textuelle
  3. Synthèse vocale (TTS) : Convertit le texte en sortie vocale

Chaque étape a une latence, qui s'accumule, créant la sensation de parler puis d'attendre un moment avant d'obtenir une réponse. De plus, chaque conversion perd des informations — votre ton de voix, vos pauses, vos émotions disparaissent à l'étape du texte.

Ce que fait Gemini 3.1 Flash Live

Il comprime ce pipeline en trois étapes en un modèle natif audio vers audio (audio-to-audio).

Sans passer par l'état intermédiaire du texte, directement de votre entrée vocale à la sortie vocale.

Spécifications techniques :

  • Entrée audio : PCM 16 bits, taux d'échantillonnage de 16 kHz
  • Sortie audio : 24 kHz
  • Méthode de connexion : Connexion longue avec état basée sur WebSocket
  • Prend en charge plus de 70 langues

Comme il n'y a pas d'étapes de conversion intermédiaires, la latence est considérablement réduite et des informations telles que l'intonation et le débit de parole, absentes du texte, peuvent être capturées.

Ce qu'il peut faire concrètement

Fonction d'interruption (Barge-in) : Vous pouvez interrompre l'IA pendant qu'elle parle, poser une nouvelle question ou changer de direction — le TTS traditionnel ne peut pas faire cela ; vous devez attendre la fin d'une phrase pour dire la suivante.

Appel d'outils : Peut appeler des fonctions et la Recherche Google, ce qui signifie que pendant le dialogue vocal, le modèle peut consulter des informations et exécuter des actions en temps réel.

Transcription bilatérale : Le contenu des deux côtés de la conversation peut être transcrit simultanément, facilitant l'enregistrement et l'analyse.

Deux modes de déploiement : Serveur à serveur (adapté aux systèmes backend comme les chatbots de service client) et client à serveur (adapté aux applications vocales directement orientées vers l'utilisateur).

Résultats des benchmarks

ComplexFuncBench Audio, un test qui mesure spécifiquement les performances des modèles vocaux dans des scénarios complexes d'appel de fonctions, Gemini 3.1 Flash Live a obtenu 90,8 %.

Impact pratique

L'un des plus grands obstacles de l'IA vocale actuellement est la sensation de pause, comme lorsque l'on passe un appel téléphonique qui n'est pas encore connecté. Réduire la latence et permettre les interruptions sont des conditions nécessaires pour rapprocher l'interaction vocale d'une conversation naturelle.

Ce modèle est mis à la disposition des développeurs via l'API Gemini Live dans Google AI Studio et a également été intégré à Gemini Live (pour les utilisateurs dans plus de 200 pays).

La stratégie de Google dans le domaine vocal, de Gemini 2.5 Flash Native Audio au Gemini 3.1 Flash Live actuel, est très cohérente : traiter la voix comme un citoyen de première classe, plutôt que de simplement coller une couche TTS sur un LLM.

Source de référence : Gemini 3.1 Flash Live: Making audio AI more natural and reliable (Google Blog) ; CocoLoop, Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model (MarkTechPost) ; Gemini Live gets its biggest upgrade yet with Gemini 3.1 Flash Live (9to5Google)