AIアシスタントは、ユーザーの話を途中で遮るか、画面と音声を別々の工程で処理して反応が遅れることが多い。
ByteDance Seed は 8 月 5 日、原生音声・映像全二重モデル SeedRealtime を発表し、豆包 App で全量提供を始めたと説明した。ユーザーは最新版の豆包で「通話」を選び、映像、音声、テキストを同時に扱うビデオ通話画面に入れる。
入口がニュースになる
Phoenix Tech と IT之家はいずれも、豆包 App への全量上线と「通話」入口を確認している。これは、単なる研究デモや予約制のモデル発表とは違う。
公式の技術説明では、SeedRealtime は統一されたエンドツーエンド構成を使う。ASR、視覚モデル、会話モデル、TTS、VAD を順につなぐのではなく、連続するマルチモーダル流の中で知覚、理解、判断、応答を同時に行う設計だ。
「AI 交互不再局限于清晰轮次中的问答」
確認できる数字は慎重に読む必要がある。公式と複数媒体は、エンドツーエンドの人手評価で、級聯系統に比べて音声・映像対話のリズム問題が半減したと伝えた。対象は割り込み、返答遅れ、背景音による誤応答などであり、公開ベンチマークや遅延 50% 改善を意味しない。
難しいのは沈黙の判断
公式例では、複数人の食事で発話者を見分ける、中国語メニューを外国人客に説明する、博物館で指定展示物を見つけて知らせる、コーヒーマシン操作を訂正する、ResNet 論文の指定節で止める、といった場面が示された。
共通する課題は、何を見たかと、今話すべきかを結び付けることだ。ビデオ通話では、背景の雑談を無視し、少し前に見た情報を保持し、必要な時だけ介入しなければならない。
次の検証点
中国市場ではこの入口に実用上の意味がある。ユーザーはメニュー、家電、学校教材、標識、仕事資料をスマホで見せながら質問する可能性が高い。豆包で「見ながら話す」が安定すれば、ByteDance はテキストチャットより細かい利用データを得られる。
一方で、公式が今後の課題として挙げるのは、低遅延、能動的な知覚と判断、多人場景の安定性、工具呼び出しだ。実際の確認点は、遅延、誤起動率、発話者と指示対象の安定性、現実のタスク完了率になる。
出典:ByteDance Seed 公式技術ブログ、Phoenix Tech、IT之家、CocoLoop。豆包 App 入口、統一エンドツーエンド構成、三つの中核能力、人手評価でリズム問題が半減した口径、今後の改善方向を確認。