Doubao bắt đầu gọi video AI

Trợ lý AI thường vấp ở hai chỗ: chen lời trước khi người dùng nói xong, hoặc phản ứng chậm vì phải đi qua chuỗi nhận dạng giọng nói, thị giác, hội thoại và tổng hợp giọng nói.

ByteDance Seed ngày 5 tháng 8 công bố SeedRealtime và cho biết mô hình nghe-nhìn full-duplex native này đã được triển khai toàn bộ trong ứng dụng Doubao. Người dùng cập nhật Doubao, chọn "gọi" trong ô trò chuyện và vào giao diện gọi video, nơi mô hình nhận hình ảnh, âm thanh và văn bản cùng lúc.

Lối vào mới là tin chính

Phoenix Tech và IT Home đều xác nhận trạng thái triển khai cùng lối vào gọi trong Doubao. Điều này khác với những bản phát hành đa phương thức chỉ nằm ở trang dự án hoặc danh sách chờ.

Luận điểm kỹ thuật chính thức là kiến trúc end-to-end thống nhất. Thay vì nối ASR, mô hình thị giác, mô hình hội thoại, TTS và quy tắc VAD, SeedRealtime được thiết kế để cảm nhận, hiểu, quyết định và phản hồi trong một luồng đa phương thức liên tục.

“我们希望,AI 交互不再局限于清晰轮次中的问答。”

Con số rõ nhất cần đọc đúng phạm vi: đánh giá thủ công end-to-end cho thấy vấn đề nhịp hội thoại nghe-nhìn giảm một nửa so với hệ thống ghép tầng. Nó nói về chen lời, trả lời chậm và kích hoạt sai bởi tiếng ồn nền, không phải benchmark độ trễ công khai.

Cái khó là biết khi nào im lặng

Các ví dụ chính thức gồm nhận diện người nói trong bữa ăn nhóm, giải thích thực đơn Trung Quốc cho khách nước ngoài, nhắc khi thấy hiện vật bảo tàng, sửa thao tác máy pha cà phê và dừng ở đúng mục khi người dùng lật bài ResNet.

Tất cả đều kiểm tra một năng lực: nối điều mô hình nhìn thấy với việc có nên nói hay không. Trong gọi video, trợ lý phải bỏ qua lời nói nền, nhớ thông tin vừa thấy và chỉ can thiệp khi người dùng cần.

Bài kiểm tra tiếp theo

Ở thị trường Trung Quốc, lối vào này có ý nghĩa thực tế. Người dùng thường giơ điện thoại vào thực đơn, đồ gia dụng, bài học, biển chỉ đường hoặc tài liệu công việc. Nếu "vừa nhìn vừa nói" ổn định trong Doubao, ByteDance sẽ có phản hồi sử dụng giàu hơn chatbot văn bản.

Giới hạn cũng rõ. ByteDance nêu các hướng tiếp theo: giảm độ trễ end-to-end, nhận thức và quyết định chủ động hơn, ổn định hơn trong cảnh nhiều người, và gọi công cụ. Thước đo thực tế sẽ là độ trễ, tỷ lệ kích hoạt sai, độ ổn định khi quy chiếu người-vật và tỷ lệ hoàn thành tác vụ thật.

Nguồn: blog kỹ thuật ByteDance Seed, Phoenix Tech, IT Home, CocoLoop; kiểm chứng lối vào ứng dụng Doubao, kiến trúc end-to-end thống nhất, ba năng lực lõi, tuyên bố đánh giá thủ công rằng vấn đề nhịp giảm một nửa, và hướng tối ưu tiếp theo.