Google lance la synthèse vocale Gemini 3.8, clonage possible avec 30 secondes d'audio

Le 23 septembre, Google a présenté deux modèles de synthèse vocale : Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS. Le premier vise les usages créatifs qui exigent un contrôle fin du ton et la construction de personnages, le second cible les appels en grand volume à faible coût. Les deux sont disponibles dès le jour du lancement sur la Gemini API et Google AI Studio, la version entreprise Gemini Enterprise devant suivre.

Ce que permettent les modèles

Les voix proviennent de trois sources : 30 voix natives, plus de 2 000 voix prêtes à l'emploi et directement utilisables à des fins commerciales, ainsi que des voix personnalisées créées par l'utilisateur. Pour créer une voix personnalisée, un échantillon audio de 30 secondes suffit ; Google affirme prendre en charge plus de 100 langues et dialectes. La fonction de mélange de voix est indiquée comme "à venir".

Côté contrôle, les développeurs peuvent rédiger en langage naturel des indications de jeu, réplique par réplique — préciser par exemple quelle phrase doit être dite plus bas ou avec un rire. Le modèle prend nativement en charge les scènes de dialogue à deux voix et peut insérer, selon le script, rires, soupirs, inspirations et interjections telles que "hum" ou "oui". Google affirme également que la qualité audio ne se dégrade pas de manière perceptible sur des contenus de plusieurs heures.

Les deux modèles sont aussi accessibles au grand public : Flash TTS a été intégré à Gemini Notebook, Flash-Lite TTS à Google Vids, tous deux utilisables par les utilisateurs ordinaires. Dix entreprises, dont Agora, LiveKit, Pipecat, Vercel, Figma et HeyGen, forment le premier groupe de partenaires d'intégration.

Le clonage vocal soumis à des restrictions régionales

Google a mis en place plusieurs garde-fous pour la fonction de clonage : tout audio généré porte un filigrane SynthID, une vérification de consentement est requise avant le clonage, et des identifiants de contenu C2PA y sont ajoutés. La fonction de clonage n'est pour l'instant pas disponible dans les États américains de l'Illinois et du Texas, ni dans l'Espace économique européen, au Royaume-Uni, en Suisse et en Inde. L'Illinois et le Texas disposent chacun d'une loi spécifique de protection des données biométriques.

Côté évaluations, Google cite le benchmark de conception vocale de Hume AI, selon lequel Flash TTS arrive en tête du classement général ainsi qu'en modélisation des accents ; sur Voice Arena, le modèle figure parmi les premiers dans les classements pour le japonais, le portugais du Brésil, le vietnamien, l'arabe standard moderne, l'espagnol mexicain et l'hindi. Il s'agit de résultats de classements tiers rapportés par Google ; l'annonce ne mentionne pas séparément les performances en chinois.

Faire le calcul

Selon la page tarifaire de la Gemini API, la sortie audio est facturée à raison de 25 jetons par seconde. Une heure de voix équivaut donc à 90 000 jetons audio. Une estimation approximative selon le prix par million de jetons en sortie :

ModèleJusqu'à fin 2026À partir du 1/1/2027
3.8 Flash TTS (9 $ / 18 $)environ 0,81 $/heureenviron 1,62 $/heure
3.8 Flash-Lite TTS (6 $ / 12 $)environ 0,54 $/heureenviron 1,08 $/heure
2.5 Flash TTS (préliminaire) (10 $)environ 0,90 $/heure—

Le prix de l'entrée texte est de 0,5 $ par million de jetons jusqu'à la fin de l'année, puis 1 $ l'an prochain ; le volume de texte d'une heure de dialogue ne représente que quelques dizaines de milliers de caractères, ce qui rend cette part quasi négligeable. Le traitement par lots (batch) bénéficie en outre d'une remise supplémentaire de 50 %.

En faisant ce calcul, pour les un peu plus de trois mois restants de cette année, les nouveaux modèles reviennent moins cher que l'ancienne version préliminaire ; à partir de l'an prochain, le tarif horaire de Flash augmentera d'environ 80 %, et Flash-Lite coûtera lui aussi plus cher que l'ancienne version. Google n'a pas expliqué pourquoi il a retenu cette structure tarifaire — moitié prix maintenant, doublement une fois le délai passé. Pour les activités qui consomment de la voix à l'heure, comme les livres audio, les podcasts ou le service client, un coût d'environ 1 dollar de l'heure reste bien inférieur à celui d'un comédien de doublage ; ce qui déterminera l'adoption sera plus probablement la qualité audio et le résultat du clonage, cet écart de quelques centimes ayant un impact limité.

Sources : blog officiel de Google, page tarifaire de la Gemini API, CocoLoop, Hume AI ; ont été vérifiés le nombre de voix, la durée de l'échantillon de clonage, les restrictions régionales et le prix de sortie par million de jetons audio.