KI-Assistenten scheitern oft an zwei Stellen: Sie antworten zu früh, oder sie reagieren zu langsam, weil Sprache, Bild, Dialog und Sprachausgabe nacheinander verarbeitet werden.
ByteDance Seed stellte SeedRealtime am 5. August vor und sagt, das native audiovisuelle Full-Duplex-Modell sei nun vollständig in der Doubao-App verfügbar. Nutzer können Doubao aktualisieren, im Chatfenster "Call" wählen und in eine Videoanruf-Oberfläche wechseln, in der Video, Audio und Text gemeinsam verarbeitet werden.
Der Einstieg macht den Unterschied
Phoenix Tech und IT Home bestätigten sowohl die Verfügbarkeit in Doubao als auch den Call-Einstieg. Damit unterscheidet sich der Start von multimodalen Demos, die auf Projektseiten oder Wartelisten bleiben.
Die technische Behauptung ist eine einheitliche End-to-End-Architektur. Statt ASR, Vision-Modell, Dialogmodell, TTS und VAD-Regeln zu verketten, soll SeedRealtime in einem kontinuierlichen multimodalen Strom wahrnehmen, verstehen, entscheiden und antworten.
“我们希望,AI 交互不再局限于清晰轮次中的问答。”
Die wichtigste Zahl hat klare Grenzen: Laut offizieller Darstellung sanken in einer End-to-End-Bewertung durch Menschen die Rhythmusprobleme im audiovisuellen Dialog gegenüber einem Kaskadensystem um die Hälfte. Gemeint sind Unterbrechungen, späte Antworten und Fehlreaktionen auf Hintergrundgeräusche, kein öffentlicher Latenz-Benchmark.
Schwierig ist das Schweigen
Die offiziellen Beispiele zeigen Sprechererkennung beim Gruppenessen, Menüerklärung für ausländische Gäste, Hinweise im Museum, Korrekturen an einer Kaffeemaschine und das Stoppen an einer Zielstelle in einem ResNet-Paper.
Alle Beispiele prüfen dieselbe Fähigkeit: Was sieht das Modell, und sollte es jetzt sprechen? In einem Videoanruf muss der Assistent Hintergrundgespräche ignorieren, gerade gesehene Informationen behalten und nur im passenden Moment eingreifen.
Was als Nächstes zählt
In China ist dieser Einstieg praktisch relevant. Nutzer zeigen dem Telefon eher Menüs, Geräte, Schulmaterial, Schilder oder Arbeitsdokumente. Wenn "sehen und sprechen" in Doubao stabil wird, bekommt ByteDance deutlich feinere Nutzungssignale als bei Text-Chats.
Die Grenzen sind ebenfalls sichtbar. ByteDance nennt geringere End-to-End-Latenz, aktivere Wahrnehmung und Entscheidungen, stabilere Mehrpersonenszenen und Tool-Aufrufe als nächste Arbeiten. Die echten Messpunkte sind Latenz, Fehltrigger, Stabilität bei Personen- und Objektbezug sowie tatsächliche Aufgabenerledigung.
Quellen: technischer Blog von ByteDance Seed, Phoenix Tech, IT Home, CocoLoop; geprüft wurden der Doubao-App-Einstieg, die einheitliche End-to-End-Architektur, drei Kernfähigkeiten, die Angabe halbierter Rhythmusprobleme in der menschlichen Bewertung und die nächste Optimierungsrichtung.