豆包視訊通話開始邊看邊聊

手機裡的 AI 助手,過去最怕兩件事:你還沒說完它就搶答,或者你拿鏡頭給它看東西,它先把畫面、語音和輪次拆成幾段再慢慢處理。

字節 Seed 8 月 5 日發布 SeedRealtime,官方稱這是原生音視頻全雙工大模型,已經在豆包 App 全量上線。使用者把豆包更新到最新版本後,在對話框裡選擇「打電話」,就能進入視訊通話介面,讓模型同時接收畫面、聲音和文字。

發布點落在豆包入口

鳳凰網科技和 IT之家均確認,SeedRealtime 已在豆包 App 全量上線,入口是對話框內的「打電話」。這讓它和許多只停留在專案頁、論文頁或內測預約裡的多模態發布區分開來。

官方給出的技術框架是統一端到端架構,原生融合音頻、視頻和文字。傳統鏈路通常把 ASR、視覺模型、對話模型、TTS 和 VAD 輪次判斷串起來;SeedRealtime 的說法是,在連續多模態資訊流中同步完成感知、理解、決策與表達,減少多模組串聯帶來的延遲和資訊損耗。

「我們希望,AI 交互不再局限於清晰輪次中的問答。」

難的是何時不開口

官方演示包括多人聚餐識別發言者、中文菜單跨語言解釋、博物館展品提醒、咖啡機操作糾錯、閱讀 ResNet 論文時在指定章節叫停。這些例子指向同一件事:模型要把「看見什麼」和「現在該不該說」綁在一起。

最清楚的數字也要按官方口徑讀。端到端人工評測顯示,相比級聯系統,SeedRealtime 的音視頻對話節奏問題減少一半,問題類型包括搶話、回應遲緩和背景噪聲誤觸發。這只是官方評測口徑,不能改寫成延遲下降 50%。

入口競爭變了

過去半年,國內大模型發布常圍繞榜單、上下文長度、價格或開源權重展開。SeedRealtime 更像是把模型能力壓進一個高頻消費入口:豆包的視訊通話。

如果入口成立,多模態能力會進入導覽、教學、看護、設備操作和現場客服。限制也清楚:官方把下一步寫成更低端到端延遲、更主動的感知與決策、更穩健的多人複雜場景,以及工具調用。實際檢查點是延遲、誤觸發率、多人指代穩定性和真實任務完成率。

這條新聞不該被寫成豆包追上某個模型。更準確的觀察是,字節把多模態實時互動推到消費端入口,後續使用者會用真實噪聲、真實鏡頭和真實任務替它做壓力測試。

參考來源:字節跳動 Seed 官方技術博客、鳳凰網科技、IT之家、CocoLoop;核驗豆包 App 上線入口、統一端到端架構、三項核心能力、端到端人工評測「節奏問題減少一半」口徑和下一步優化方向。