더우바오, 보며 말하는 AI 통화

AI 비서는 사용자가 말을 끝내기 전에 끼어들거나, 화면과 음성을 여러 모듈로 나눠 처리하느라 늦게 반응하는 일이 잦다.

ByteDance Seed는 8월 5일 원생 영상·음성 전이중 모델 SeedRealtime을 발표하고, 더우바오 앱에 전면 적용했다고 밝혔다. 사용자는 최신 버전에서 대화창의 "통화"를 선택해 영상, 음성, 텍스트를 함께 받는 비디오 통화 화면으로 들어갈 수 있다.

入口가 뉴스다

Phoenix Tech와 IT之家 모두 더우바오 앱 전면上线과 "통화"入口를 확인했다. 이는 프로젝트 페이지나 대기자 명단에 머무는 멀티모달 발표와 다르다.

공식 기술 설명은 통합 엔드투엔드 구조다. ASR, 비전 모델, 대화 모델, TTS, 외부 VAD 규칙을 순차 연결하는 대신, 연속 멀티모달 흐름 안에서 지각, 이해, 판단, 표현을 동시에 수행한다는 설명이다.

“我们希望,AI 交互不再局限于清晰轮次中的问答。”

가장 분명한 숫자는 조심스럽게 읽어야 한다. 공식과 매체들은 엔드투엔드 인공 평가에서级联系统 대비 영상·음성 대화 리듬 문제가 절반 줄었다고 전했다. 이는 끼어들기, 응답 지연, 배경 잡음 오작동을 가리키며 공개 지연 benchmark나 속도 50% 개선을 뜻하지 않는다.

어려운 것은 침묵 판단

공식 예시는 여러 사람이 있는 식사 자리에서 발화자를 구분하고, 중국어 메뉴를 외국인에게 설명하며, 박물관 전시물을 찾아 알려주고, 커피머신 조작을 바로잡고, ResNet 논문의 목표 절에서 멈추는 장면을 보여준다.

공통 과제는 보이는 것과 지금 말해야 하는지를 연결하는 일이다. 영상 통화 AI는 배경 대화를 무시하고, 방금 본 정보를 기억하며, 필요한 순간에만 개입해야 한다.

다음 검증 지점

중국 시장에서는 이入口가 실용적 의미를 가진다. 사용자가 메뉴, 가전, 학습지, 표지판, 업무 문서를 휴대폰 카메라로 보여 주며 묻는 상황이 많기 때문이다. 더우바오 안에서 "보며 말하기"가 안정되면 ByteDance는 텍스트 챗봇보다 세밀한 사용 피드백을 얻을 수 있다.

한계도 분명하다. ByteDance가 다음 과제로 제시한 것은 낮은 엔드투엔드 지연, 능동적 인식과 판단, 복잡한多人场景 안정성, 도구 호출이다. 실제 검증 지표는 지연, 오작동률, 발화자·지시 대상 안정성, 실제 작업 완료율이다.

출처: ByteDance Seed 공식 기술 블로그, Phoenix Tech, IT之家, CocoLoop; 더우바오 앱入口, 통합 엔드투엔드 구조, 세 가지 핵심 능력, 인공 평가에서 리듬 문제가 절반 감소했다는口径, 향후 개선 방향을 확인.