Google baut Sprach-KI um und veröffentlicht Gemini 3.1 Flash Live

Am 26. März veröffentlichte Google Gemini 3.1 Flash Live.

Wenn Sie denken, dies sei nur eine schnellere und günstigere Sprachsynthese-API, lohnt sich ein zweiter Blick. Dieses Modell bringt eine grundlegende Änderung der technischen Architektur mit sich.

Wie traditionelle Sprach-KI funktioniert

Die bisherige KI-Sprachinteraktion war im Wesentlichen eine dreistufige Pipeline:

  1. Spracherkennung (ASR): Wandelt Ihre Audioeingabe in Text um
  2. Sprachmodell-Inferenz: Der Text wird in das LLM eingegeben, um eine Textantwort zu generieren
  3. Sprachsynthese (TTS): Wandelt den Text wieder in eine Sprachausgabe um

Jeder Schritt hat eine Latenz, die sich summiert und das Gefühl erzeugt, nach dem Sprechen einen Moment warten zu müssen, bevor eine Antwort kommt. Außerdem geht bei jeder Umwandlung Information verloren – Ihr Tonfall, Ihre Pausen, Ihre Emotionen verschwinden im Textschritt.

Was Gemini 3.1 Flash Live tut

Es komprimiert diese dreistufige Pipeline zu einem nativen Audio-zu-Audio-Modell.

Ohne den Zwischenzustand Text, direkt von Ihrer Spracheingabe zur Sprachausgabe.

Technische Spezifikationen:

  • Audioeingabe: 16-Bit-PCM, 16-kHz-Abtastrate
  • Audioausgabe: 24 kHz
  • Verbindungsmethode: Zustandsbehaftete Langzeitverbindung über WebSocket
  • Unterstützt über 70 Sprachen

Da es keine Zwischenumwandlungsschritte gibt, wird die Latenz erheblich reduziert, und Informationen wie Tonfall und Sprechgeschwindigkeit, die im Text nicht enthalten sind, können erfasst werden.

Konkrete Funktionen

Unterbrechungsfunktion (Barge-in): Sie können die KI während des Sprechens unterbrechen, um eine neue Frage zu stellen oder die Richtung zu ändern – herkömmliches TTS kann das nicht; Sie müssen warten, bis ein Satz zu Ende gesprochen ist, bevor Sie den nächsten sagen können.

Tool-Aufruf: Kann Funktionen und die Google-Suche aufrufen, was bedeutet, dass das Modell während des Sprachdialogs in Echtzeit Informationen nachschlagen und Aktionen ausführen kann.

Beidseitige Transkription: Der Inhalt beider Gesprächspartner kann gleichzeitig transkribiert werden, was die Aufzeichnung und Analyse erleichtert.

Zwei Bereitstellungsmodi: Server-zu-Server (geeignet für Backend-Systeme wie Chatbots im Kundenservice) und Client-zu-Server (geeignet für direkt benutzerorientierte Sprachanwendungen).

Benchmark-Ergebnisse

ComplexFuncBench Audio, ein Test, der speziell die Leistung von Sprachmodellen in komplexen Funktionsaufrufszenarien misst, Gemini 3.1 Flash Live erreichte 90,8 %.

Praktische Auswirkungen

Eines der größten Hindernisse für Sprach-KI ist derzeit das Gefühl der Pause, ähnlich wie wenn man telefoniert und die Verbindung noch nicht hergestellt ist. Die Reduzierung der Latenz und die Unterstützung von Unterbrechungen sind notwendige Bedingungen, um die Sprachinteraktion wirklich einer natürlichen Konversation anzunähern.

Dieses Modell wird Entwicklern über die Gemini Live API in Google AI Studio zur Verfügung gestellt und ist auch in Gemini Live integriert (für Nutzer in über 200 Ländern).

Die Strategie von Google im Sprachbereich, von Gemini 2.5 Flash Native Audio bis zum aktuellen Gemini 3.1 Flash Live, ist sehr konsistent: Sprache als erstklassige Bürgerin zu behandeln, anstatt nur eine TTS-Schicht auf ein LLM zu kleben.

Quellenangabe: Gemini 3.1 Flash Live: Making audio AI more natural and reliable (Google Blog); CocoLoop, Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model (MarkTechPost); Gemini Live gets its biggest upgrade yet with Gemini 3.1 Flash Live (9to5Google)