Doubao estrena videollamadas con IA

Los asistentes de IA suelen fallar en dos puntos: responden antes de que el usuario termine o tardan porque encadenan reconocimiento de voz, visión, diálogo y síntesis de voz.

ByteDance Seed lanzó SeedRealtime el 5 de agosto y afirma que el modelo audiovisual full-duplex nativo ya está disponible para todos en la app Doubao. El usuario puede actualizar Doubao, elegir "call" en el cuadro de chat y entrar en una interfaz de videollamada que recibe imagen, audio y texto a la vez.

La entrada en la app importa

Phoenix Tech e IT Home confirmaron tanto la disponibilidad en Doubao como el acceso por la función de llamada. Eso diferencia el lanzamiento de demos multimodales que permanecen en páginas de proyecto o listas de espera.

La explicación técnica oficial es una arquitectura unificada de extremo a extremo. En lugar de encadenar ASR, visión, modelo conversacional, TTS y reglas externas de VAD, SeedRealtime está diseñado para percibir, entender, decidir y responder en un flujo multimodal continuo.

“我们希望,AI 交互不再局限于清晰轮次中的问答。”

La cifra más clara tiene límites: según la evaluación humana de extremo a extremo, los problemas de ritmo en el diálogo audiovisual se redujeron a la mitad frente a un sistema en cascada. Incluye interrupciones, respuestas tardías y activaciones por ruido de fondo; no es un benchmark público de latencia.

Lo difícil es saber callar

Los ejemplos oficiales incluyen reconocer hablantes en una comida de grupo, explicar un menú chino a un extranjero, avisar cuando aparece una pieza de museo, corregir el uso de una cafetera y detenerse en una sección de un paper de ResNet.

Todos prueban lo mismo: conectar lo que el modelo ve con si debe hablar ahora. En una videollamada, el asistente debe ignorar conversaciones de fondo, recordar lo visto hace unos segundos e intervenir solo cuando el usuario lo necesita.

Qué se comprobará después

En China, esta entrada tiene valor práctico. Los usuarios tienden a apuntar el móvil a menús, electrodomésticos, tareas escolares, señales o documentos de trabajo. Si "ver y hablar" se estabiliza en Doubao, ByteDance recibirá señales de uso más ricas que las de un chatbot de texto.

Los límites también son claros. ByteDance menciona menor latencia de extremo a extremo, percepción y decisión más proactivas, escenas con varias personas más estables y uso de herramientas como próximos pasos. Las métricas reales serán latencia, falsos disparos, estabilidad de referencias entre personas y objetos, y finalización de tareas.

Fuentes: blog técnico de ByteDance Seed, Phoenix Tech, IT Home, CocoLoop; se verifican la entrada en Doubao, la arquitectura unificada de extremo a extremo, tres capacidades centrales, la afirmación de evaluación humana de que los problemas de ritmo se redujeron a la mitad y la hoja de ruta de optimización.