Google hat am 23. September zwei Sprachsynthese-Modelle vorgestellt: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS. Ersteres richtet sich an kreative Anwendungen, die eine feine Kontrolle über Tonfall und Charaktergestaltung benötigen, Letzteres ist auf große Mengen und niedrige Kosten pro Aufruf ausgelegt. Beide sind ab dem Starttag über die Gemini API und Google AI Studio verfügbar, die Unternehmensversion Gemini Enterprise folgt später.
Was die Modelle können
Stimmen gibt es aus drei Quellen: 30 native Stimmen, mehr als 2.000 fertige, direkt kommerziell nutzbare Stimmen sowie selbst erstellte, individuelle Stimmen. Für eine eigene Stimme reicht eine 30-sekündige Audioprobe; Google gibt an, mehr als 100 Sprachen und Dialekte zu unterstützen. Eine Funktion zum Mischen von Stimmen ist als "demnächst verfügbar" gekennzeichnet.
Bei der Steuerung können Entwickler in natürlicher Sprache satzweise Regieanweisungen formulieren, etwa welcher Satz leiser gesprochen oder mit Lachen unterlegt werden soll. Das Modell unterstützt nativ Dialogszenen mit zwei Personen und kann laut Skript Lachen, Seufzen, Einatmen sowie Füllwörter wie "hm" oder "genau" einfügen. Google zufolge lässt die Klangqualität auch bei mehrstündigen Inhalten nicht merklich nach.
Beide Modelle sind auch für Endnutzer zugänglich: Flash TTS ist in Gemini Notebook integriert, Flash-Lite TTS in Google Vids – beide können von normalen Nutzern verwendet werden. Zehn Unternehmen, darunter Agora, LiveKit, Pipecat, Vercel, Figma und HeyGen, gehören zur ersten Gruppe von Integrationspartnern.
Stimmenklonen regional eingeschränkt
Google hat für die Klonfunktion mehrere Schutzmechanismen eingebaut: Jedes erzeugte Audio trägt ein SynthID-Wasserzeichen, vor dem Klonen ist eine Zustimmungsprüfung erforderlich, zusätzlich gibt es C2PA-Inhaltsnachweise. Die Klonfunktion ist derzeit in den US-Bundesstaaten Illinois und Texas sowie im Europäischen Wirtschaftsraum, in Großbritannien, der Schweiz und Indien nicht verfügbar. Illinois und Texas verfügen jeweils über eigene Gesetze zum Schutz biometrischer Daten.
Bei den Bewertungen verweist Google auf den Stimmdesign-Benchmark von Hume AI, wonach Flash TTS in der Gesamtwertung sowie bei der Nachbildung von Akzenten jeweils den ersten Platz belegt; in der Voice Arena liegt das Modell in den Rankings für Japanisch, brasilianisches Portugiesisch, Vietnamesisch, modernes Hocharabisch, mexikanisches Spanisch und Hindi weit vorn. Dabei handelt es sich um von Google zitierte Ergebnisse Dritter; zur Leistung im Chinesischen macht die Ankündigung keine gesonderten Angaben.
Eine Beispielrechnung
Laut Preisseite der Gemini API wird die Audioausgabe mit 25 Token pro Sekunde abgerechnet. Eine Stunde Sprache entspricht damit 90.000 Audio-Token. Grob gerechnet nach dem Preis pro Million Ausgabe-Token:
| Modell | Bis Ende 2026 | Ab 1. Januar 2027 |
|---|---|---|
| 3.8 Flash TTS (9 USD / 18 USD) | ca. 0,81 USD/Stunde | ca. 1,62 USD/Stunde |
| 3.8 Flash-Lite TTS (6 USD / 12 USD) | ca. 0,54 USD/Stunde | ca. 1,08 USD/Stunde |
| 2.5 Flash TTS Vorschau (10 USD) | ca. 0,90 USD/Stunde | — |
Der Preis für Texteingaben liegt bis Jahresende bei 0,5 US-Dollar pro Million Token, im nächsten Jahr bei 1 US-Dollar; der Textumfang einer Stunde Dialog beträgt nur einige Zehntausend Zeichen, dieser Anteil fällt kaum ins Gewicht. Bei Batch-Verarbeitung gibt es zusätzlich 50 Prozent Rabatt.
Rechnet man so weiter, sind die neuen Modelle für die restlichen gut drei Monate dieses Jahres günstiger als die alte Vorschauversion; ab nächstem Jahr wird Flash pro Stunde rund 80 Prozent teurer, auch Flash-Lite kostet dann mehr als die alte Version. Warum Google diese Preisstruktur – erst halber Preis, dann Verdopplung nach Ablauf – gewählt hat, erklärt das Unternehmen nicht. Für Geschäftsmodelle mit stundenweisem Sprachverbrauch wie Hörbücher, Podcasts oder Kundenservice liegen die Kosten von rund einem US-Dollar pro Stunde weiterhin deutlich unter denen echter Sprecher; ausschlaggebend für die Wahl dürften eher Klangqualität und Klonergebnis sein, der Unterschied von wenigen Cent dürfte kaum ins Gewicht fallen.
Quellen: offizieller Google-Blog, Preisseite der Gemini API, CocoLoop, Hume AI; abgeglichen wurden Anzahl der Stimmen, Länge der Klon-Probe, regionale Einschränkungen sowie der Ausgabepreis pro Million Audio-Token.