谷歌把手语AI装进Pixel

Pixel 11 上多了一个不靠语音的输入方式:用户对着手机打美国手语,Gboard 和 Live Transcribe 会把它变成英文文字。

Google DeepMind 8 月 12 日发布 SL2T,一套大规模多语言手语转文字模型。它先支持美国手语到英语,落地在 Pixel 11 的 Gboard 和 Live Transcribe,后续再扩展到更多设备和更多手语。对听障用户来说,它已经走出实验室,进入搜索、消息、文档和 Gemini 提问这些直接可用的输入入口。

DeepMind 在发布文中把这次节点说得很直白:

“we are bringing sign language AI out of the lab and into consumer products for the first time”

自然一点说,就是手语 AI 第一次从论文和样机走进主流消费产品。

手语有自己的语法

这件事容易被低估。语音转文字已经很常见,很多人会顺手把手语理解成“把每个手势替换成一个词”。DeepMind 反复强调,手语是独立自然语言,有自己的语法、词汇和空间表达,不能按英语单词逐个映射。

SL2T 因此被做成翻译模型,区别于逐帧识别模型。它要理解手、手臂、躯干、头部和面部动作的组合,再把这些视觉语言翻成连续文本。难点包括高速跟踪全身关键点、处理非手部标记、理解空间结构,并在手机场景里保持可用延迟。

Google 给出的使用场景也更具体:用户可以用手语搜索网页、写消息、起草文档,或者向 Gemini 提交任务;在 Live Transcribe 里,也能用手语回复对话,不必来回打字。DeepMind 称测试者反馈,使用美国手语比输入英文更快、更自然。

10 万小时训练,但不上传原始视频

这次发布最硬的数字有三组。第一,SL2T 使用超过 10 万小时数据训练,覆盖 50 多种手语,其中大约四分之一是美国手语。第二,在 FLEURS-ASL 的 ASL 到英语测试集上,SL2T 零样本达到 70 BLEURT,DeepMind 称这一分数明显高于此前公开记录。第三,潜在受益人群指向全球约 7000 万使用手语的聋人和听障人群,范围远超一个小众插件。

隐私设计也有实际约束。SL2T 先由设备端的 MediaPipe Holistic 追踪人体姿态点,再把几何坐标序列发到服务器端翻译,原始摄像头视频无需直接进入翻译链路。原视频可以立即丢弃。换成产品语言:手机先把画面压成“骨架点位”,云端只处理这些坐标,无需查看完整视频。

这仍留下隐私问题。姿态点本身可能包含个人动作模式,实时翻译也需要网络与服务端能力。但与直接上传视频相比,它至少把数据面缩小了一层,也让以后做端侧化或更严格合规审计时有了清楚边界。

从基准分走向真实可用

70 BLEURT 是一个能写进标题的数字,但产品成败落在基准之外。DeepMind 自己也承认,只优化学术基准不能保证现实可用。团队还专门处理了流式延迟、非手语输入时的幻觉、左利手用户公平性,以及单手打手语等问题。

单手场景很关键。手机输入发生在移动环境里,并非站在镜头前完成标准测试。很多时候,用户一只手拿着手机,另一只手打手语;光线、角度、遮挡、速度都会变化。如果模型只在实验室双手、正面、完整视频里表现好,到了 Gboard 这种入口就会立刻失效。

DeepMind 还披露,项目由聋人员工 Sam Sepah 参与概念化,并建立了 AI Sign Language Advisory Committee,让多个全球聋人组织和主题专家参与部署治理。这个细节影响产品边界:手语技术不能只由听人团队按“准确率”定义成功。错误翻译、文化误读、过度自动化,都可能改变真实沟通中的权力关系。

下一步看两件事

SL2T 的短期看点落在扩展速度。首发只做美国手语到英语,功能先在 Pixel 11 上可用,这个范围很窄。后续需要观察两条线。

第一,Google 能否把更多手语加入同一套系统。全球手语超过 200 种,很多没有足够标注数据。SL2T 用 50 多种手语一起训练,说明它押注跨语言共享结构,但低资源手语能不能受益,还需要实际版本验证。

第二,它会不会从输入工具变成通用无障碍层。Gboard 和 Live Transcribe 是入口,后面可能连到视频会议、教育、客户服务、公共服务窗口和 Gemini 工作流。若这些场景上线,手语 AI 的问题会从“能不能识别”转为“出错谁负责、是否允许回看、数据如何保存、是否尊重不同社群表达”。

放到手机 AI 里看,SL2T 的分量超出普通小功能。它把模型能力、端云隐私、无障碍入口和少数语言数据问题绑在一起,给了一个可验证节点。Pixel 11 只是第一站,后续设备、语言和真实用户反馈,才会决定手语 AI 是一次发布会功能,还是进入主流输入系统的开始。

参考来源:Google DeepMind 官方发布、FLEURS-ASL 基准说明、SiliconANGLE、CocoLoop、Engadget;核验 SL2T 发布节点、Pixel 11/Gboard/Live Transcribe 落地范围、10 万小时训练数据、50 多种手语、70 BLEURT 测试口径、MediaPipe Holistic 姿态点隐私链路与首发 ASL 到英语范围。