Los asistentes de IA suelen fallar en dos puntos: responden antes de que el usuario termine o tardan porque encadenan reconocimiento de voz, visión, diálogo y síntesis de voz.
ByteDance Seed lanzó SeedRealtime el 5 de agosto y afirma que el modelo audiovisual full-duplex nativo ya está disponible para todos en la app Doubao. El usuario puede actualizar Doubao, elegir "call" en el cuadro de chat y entrar en una interfaz de videollamada que recibe imagen, audio y texto a la vez.
La entrada en la app importa
Phoenix Tech e IT Home confirmaron tanto la disponibilidad en Doubao como el acceso por la función de llamada. Eso diferencia el lanzamiento de demos multimodales que permanecen en páginas de proyecto o listas de espera.
La explicación técnica oficial es una arquitectura unificada de extremo a extremo. En lugar de encadenar ASR, visión, modelo conversacional, TTS y reglas externas de VAD, SeedRealtime está diseñado para percibir, entender, decidir y responder en un flujo multimodal continuo.
“我们希望,AI 交互不再局限于清晰轮次中的问答。”
La cifra más clara tiene límites: según la evaluación humana de extremo a extremo, los problemas de ritmo en el diálogo audiovisual se redujeron a la mitad frente a un sistema en cascada. Incluye interrupciones, respuestas tardías y activaciones por ruido de fondo; no es un benchmark público de latencia.
Lo difícil es saber callar
Los ejemplos oficiales incluyen reconocer hablantes en una comida de grupo, explicar un menú chino a un extranjero, avisar cuando aparece una pieza de museo, corregir el uso de una cafetera y detenerse en una sección de un paper de ResNet.
Todos prueban lo mismo: conectar lo que el modelo ve con si debe hablar ahora. En una videollamada, el asistente debe ignorar conversaciones de fondo, recordar lo visto hace unos segundos e intervenir solo cuando el usuario lo necesita.
Qué se comprobará después
En China, esta entrada tiene valor práctico. Los usuarios tienden a apuntar el móvil a menús, electrodomésticos, tareas escolares, señales o documentos de trabajo. Si "ver y hablar" se estabiliza en Doubao, ByteDance recibirá señales de uso más ricas que las de un chatbot de texto.
Los límites también son claros. ByteDance menciona menor latencia de extremo a extremo, percepción y decisión más proactivas, escenas con varias personas más estables y uso de herramientas como próximos pasos. Las métricas reales serán latencia, falsos disparos, estabilidad de referencias entre personas y objetos, y finalización de tareas.
Fuentes: blog técnico de ByteDance Seed, Phoenix Tech, IT Home, CocoLoop; se verifican la entrada en Doubao, la arquitectura unificada de extremo a extremo, tres capacidades centrales, la afirmación de evaluación humana de que los problemas de ritmo se redujeron a la mitad y la hoja de ruta de optimización.