Google 把手語 AI 裝進 Pixel

Pixel 11 新增了一種不靠語音的輸入方式:使用者對著手機打美國手語,Gboard 和 Live Transcribe 會把它轉成英文文字。

Google DeepMind 8 月 12 日發表 SL2T。它先支援美國手語到英文,落地在 Pixel 11 的 Gboard 和 Live Transcribe,之後會擴展到更多裝置和更多手語。這代表手語可以用在搜尋、訊息、文件、Gemini 提問和即時字幕回覆等場景。

手語不是手上的英文

手語是獨立自然語言,有自己的語法、詞彙、表情和空間結構。因此 SL2T 不是逐格手勢辨識器,而是翻譯模型。

DeepMind 表示,SL2T 使用超過 10 萬小時資料訓練,涵蓋 50 多種手語,其中約四分之一是美國手語。在 FLEURS-ASL 的美國手語到英文測試中,SL2T 零樣本達到 70 BLEURT。全球約 7000 萬聾人和聽障者使用手語,這讓產品落地本身成為一個重要節點。

隱私從姿態點開始

SL2T 不把原始攝影機畫面直接送去翻譯。裝置端的 MediaPipe Holistic 先追蹤人體姿態點,再把座標序列送到伺服器翻譯。與上傳完整影片相比,資料暴露面更小,但姿態資料仍需要謹慎處理。

真正的產品考驗也不只在分數。Google 稱團隊處理了串流延遲、非手語輸入時的幻覺、左撇子使用者,以及一手拿手機、一手打手語等問題。

下一步看擴展

首發範圍仍窄:Pixel 11 上的美國手語到英文。接下來要看 Google 是否能把更多手語,尤其是資料較少的手語,加入同一套系統。

另一個問題是,手語輸入會不會成為通話、教育、客服、公共服務和 AI 工作流裡的通用無障礙層。SL2T 不是單純的手機 AI 功能,而是把模型規模、無障礙、隱私架構和少數語言資料放到同一個產品測試裡。

參考來源:Google DeepMind 官方發布、FLEURS-ASL 基準說明、SiliconANGLE、CocoLoop、Engadget;核驗 SL2T 發布範圍、Pixel 11/Gboard/Live Transcribe 整合、10 萬小時以上訓練資料、50 多種手語、70 BLEURT 測試口徑、MediaPipe Holistic 姿態點流程與首發美國手語到英文範圍。