Doubao lance les appels vidéo IA

Les assistants IA trébuchent souvent sur deux points: ils répondent avant la fin de la phrase, ou réagissent trop lentement parce que parole, vision, dialogue et voix synthétique passent par plusieurs modules.

ByteDance Seed a lancé SeedRealtime le 5 août et indique que ce modèle audiovisuel full-duplex natif est désormais déployé dans l'application Doubao. L'utilisateur met Doubao à jour, choisit "call" dans la zone de dialogue et entre dans une interface d'appel vidéo qui reçoit image, audio et texte ensemble.

L'entrée dans l'app change le sujet

Phoenix Tech et IT Home ont confirmé le déploiement dans Doubao et l'accès par la fonction d'appel. Cela distingue ce lancement des démonstrations multimodales qui restent sur une page projet ou une liste d'attente.

La thèse technique officielle repose sur une architecture unifiée de bout en bout. Au lieu d'enchaîner ASR, modèle visuel, modèle de dialogue, TTS et règles VAD, SeedRealtime doit percevoir, comprendre, décider et répondre dans un flux multimodal continu.

“我们希望,AI 交互不再局限于清晰轮次中的问答。”

Le chiffre principal doit être lu avec prudence: selon une évaluation humaine de bout en bout, les problèmes de rythme dans le dialogue audiovisuel ont été divisés par deux face à un système en cascade. Cela couvre interruptions, réponses tardives et déclenchements par bruit de fond, pas un benchmark public de latence.

Le plus dur est de savoir se taire

Les exemples officiels incluent reconnaître les locuteurs lors d'un dîner, expliquer un menu chinois à un étranger, signaler une oeuvre dans un musée, corriger l'usage d'une machine à café et s'arrêter sur une section d'un article ResNet.

Ils testent tous la même capacité: relier ce que le modèle voit au bon moment pour parler. En appel vidéo, l'assistant doit ignorer les conversations de fond, garder en mémoire ce qu'il vient de voir et intervenir seulement quand c'est utile.

Les prochains tests

En Chine, cette entrée a un poids pratique. Les utilisateurs peuvent montrer au téléphone des menus, appareils, devoirs, panneaux ou documents de travail. Si "voir et parler" devient fiable dans Doubao, ByteDance obtiendra des signaux d'usage plus riches qu'avec un chatbot texte.

Les limites sont visibles. ByteDance cite comme prochaines étapes une latence de bout en bout plus faible, une perception et une décision plus proactives, une meilleure stabilité dans les scènes à plusieurs personnes et l'appel d'outils. Les vrais critères seront la latence, les faux déclenchements, la stabilité des références et l'exécution de tâches réelles.

Sources: blog technique de ByteDance Seed, Phoenix Tech, IT Home, CocoLoop; vérification de l'entrée Doubao, de l'architecture unifiée de bout en bout, des trois capacités centrales, de l'affirmation d'une réduction de moitié des problèmes de rythme en évaluation humaine et des axes d'optimisation.