Doubao ganha chamada de vídeo com IA

Assistentes de IA costumam falhar de duas maneiras: respondem antes de o usuário terminar ou demoram porque precisam encadear reconhecimento de fala, visão, diálogo e síntese de voz.

A ByteDance Seed lançou o SeedRealtime em 5 de agosto e afirma que o modelo audiovisual full-duplex nativo já está disponível para todos no app Doubao. O usuário atualiza o app, escolhe "call" na caixa de conversa e entra numa interface de videochamada que recebe imagem, áudio e texto ao mesmo tempo.

A entrada no app é a notícia

Phoenix Tech e IT Home confirmaram a disponibilidade no Doubao e o acesso pela função de chamada. Isso diferencia o lançamento de demos multimodais que ficam em páginas de projeto.

A tese técnica oficial é uma arquitetura unificada de ponta a ponta. Em vez de encadear ASR, visão, modelo de diálogo, TTS e regras externas de VAD, o SeedRealtime deve perceber, entender, decidir e responder em um fluxo multimodal contínuo.

“我们希望,AI 交互不再局限于清晰轮次中的问答。”

O número mais claro deve ser lido com cuidado: em avaliação humana de ponta a ponta, problemas de ritmo no diálogo audiovisual caíram pela metade frente a um sistema em cascata. Isso cobre interrupções, respostas tardias e disparos por ruído de fundo, não um benchmark público de latência.

O difícil é saber calar

Os exemplos oficiais incluem identificar falantes em jantar de grupo, explicar cardápio chinês a um estrangeiro, avisar quando uma peça aparece no museu, corrigir o uso de uma máquina de café e parar em uma seção de um artigo sobre ResNet.

Todos testam a mesma capacidade: ligar o que o modelo vê ao momento certo de falar. Em uma videochamada, o assistente precisa ignorar conversa de fundo, lembrar algo visto segundos antes e intervir só quando faz sentido.

O próximo teste

Na China, essa entrada tem peso prático. Usuários tendem a apontar o celular para menus, eletrodomésticos, material escolar, placas e documentos de trabalho. Se "ver e falar" funcionar bem no Doubao, a ByteDance terá sinais de uso mais ricos do que em um chatbot de texto.

Os limites também estão claros. A ByteDance cita menor latência de ponta a ponta, percepção e decisão mais proativas, cenas com várias pessoas mais estáveis e chamadas de ferramentas como próximos passos. As métricas reais serão latência, falsos disparos, estabilidade de referência entre pessoas e objetos, e conclusão de tarefas.

Fontes: blog técnico da ByteDance Seed, Phoenix Tech, IT Home, CocoLoop; verificação cobre a entrada no app Doubao, arquitetura unificada ponta a ponta, três capacidades centrais, a alegação de avaliação humana de que problemas de ritmo caíram pela metade e a direção de otimização.