手机里的 AI 助手,过去最怕两件事:你还没说完它就抢答,或者你拿镜头给它看东西,它先把画面、语音和轮次拆成几段再慢慢处理。
字节 Seed 8 月 5 日发布 SeedRealtime,官方称这是原生音视频全双工大模型,已经在豆包 App 全量上线。用户把豆包更新到最新版本后,在对话框里选择“打电话”,就能进入视频通话界面,让模型同时接收画面、声音和文本。
这条发布的叙事钩子,比“会看图”更具体:AI 在视频通话里要判断谁在说话、用户看向哪里、什么时候该接话、什么时候该沉默。字节官方写道:“今天,我们正式推出原生音视频全双工大模型 SeedRealtime。”随后的关键句是,模型要带来“边看、边听、边说”的体验。
发布点落在豆包入口
凤凰网科技和 IT之家均确认,SeedRealtime 已在豆包 App 全量上线,入口是对话框内的“打电话”。这让它和许多只停留在项目页、论文页或内测预约里的多模态发布区分开来。
官方给出的技术框架是统一端到端架构,原生融合音频、视频和文本。传统链路通常把 ASR、视觉模型、对话模型、TTS 和 VAD 轮次判断串起来;SeedRealtime 的说法是,在连续多模态信息流中同步完成感知、理解、决策与表达,减少多模块串联带来的延迟和信息损耗。
这类说法最容易写成抽象能力清单。更硬的核验点有三个:
- 上线状态:豆包 App 已全量上线,用户可通过“打电话”体验;
- 能力结构:音视频联合理解、主动交互能力、流畅交互节奏三项核心能力;
- 评测口径:端到端人工评测显示,相比级联模型,音视频对话节奏问题减少一半。
IT之家和凤凰网对这三点的表述一致。需要谨慎的是,官方没有公开完整 benchmark 表、样本量或评测细则,因此“减少一半”只能按官方端到端人工评测口径使用,不能扩写成行业通用指标。
难的是何时不开口
视频通话 AI 的难点,不在模型会不会描述画面。难点是它能否在连续噪声里维持任务状态。
官方演示里有几个场景:多人聚餐时识别不同发言者,把名字、声音和人脸持续对应;外籍食客看中文菜单时,结合画面解释“鱼香肉丝”为什么没有鱼;在博物馆移动镜头中,等目标文物出现后主动提醒;操作咖啡机时,看到整粒咖啡豆被倒进手柄,立即纠错;读 ResNet 论文时,持续盯着翻页过程,看到 “3.4 Implementation” 后叫停。
这些例子放在一起,指向同一件事:模型要把“看见了什么”和“现在该不该说”绑在一起。字节在页面里把它拆成三个层次:音视频联合理解、主动交互、节奏判断。
官方还给了一句很适合作为产品边界的表达:
“AI 交互不再局限于清晰轮次中的问答。”
这句话里最有用的是“清晰轮次”四个字。过去语音助手假设你一句、我一句;视频通话场景里,用户会停顿、补充、打断,背景里还有别人说话。模型若只追求快,很容易把旁人闲聊当成指令;若只追求稳,又会在需要提示时慢半拍。
评测数字只能按官方口径读
“节奏问题减少一半”是这次最清楚的数字,但口径限定在官方端到端人工评测里。官方和媒体都把它对应到抢话、回应迟缓、背景噪声误触发等问题类型。
因此,读这个数字要抓住口径:它衡量的是音视频对话节奏,不等同于 ASR 字错率、视觉识别准确率、首 token 延迟或端到端毫秒级延迟。字节也没有披露硬件、并发、网络环境和样本规模,正文不能把它改写成“速度提升一倍”或“延迟下降 50%”。
更稳妥的比较对象是级联系统。级联系统的优势是模块成熟、工程可控;缺点是每一层都会丢一点上下文,还要靠 VAD 或规则判断轮次。SeedRealtime 的官方叙事是把这些判断放进同一个模型流里,让视觉、语音、时序和表达共享状态。
对普通用户来说,实际体验会落到几个小动作:它能不能在厨房噪声里听出你是在问它;能不能在镜头扫过路牌时主动提醒;能不能在孩子学英语时屏蔽旁边电话声;能不能在用户手忙脚乱时用短句纠错,少给一段长篇解释。
中国模型的入口竞争变了
这次发布的产业意义,主要在入口。
过去半年,国内大模型发布常围绕榜单、上下文长度、价格或开源权重展开。SeedRealtime 更像是把模型能力压进一个高频消费入口:豆包的视频通话。如果入口成立,多模态能力不再只服务创作和问答,还会进入导览、教学、看护、设备操作和现场客服。
这里有两段增量判断。
第一,全双工音视频对国内厂商很现实。中国 App 场景密度高,用户更可能拿手机镜头去问菜单、路标、家电、课堂和工作材料。谁先把“边看边聊”做成稳定入口,谁就能拿到比纯文本聊天更细的使用数据和场景反馈。
第二,限制也同样清楚。官方已经把下一步写出来:更低的端到端时延、更主动的感知与决策、更稳健的多人复杂场景,以及工具调用。换成产品语言,就是四个待验证指标:延迟、误触发率、多人指代稳定性、真实工具完成率。发布当天能证明的是入口和方向,不能证明它已经在所有真实场景里稳定可用。
所以这条新闻不该被写成“豆包追上某某模型”。更准确的观察是,字节把多模态实时交互推到消费端入口,后续用户会用真实噪声、真实镜头和真实任务替它做压力测试。
如果豆包视频通话能把抢话、误触发和慢反应压住,AI 助手会从聊天框往现场协作挪一步;如果做不到,它也会很快暴露在最难伪装的测试里:用户下一次会不会再打开“打电话”。
参考来源:字节跳动 Seed 官方技术博客、凤凰网科技、IT之家、CocoLoop;核验豆包 App 上线入口、统一端到端架构、三项核心能力、端到端人工评测“节奏问题减少一半”口径和下一步优化方向。