Hologram今秋上眼鏡 聲音驅動生成分身

Meta在Connect 2026大會上公布擬真虛擬分身Hologram,並敲定了上線時程:今年秋天先以搶先體驗形式登陸Ray-Ban Display智慧眼鏡,用於美國地區的WhatsApp視訊通話;全身版本則隨售價1299.99美元的Meta VR Glasses於2027年春天推出,之後再擴展到Quest 3。

這項功能背後的研究是Meta做了七年多的Codec Avatars。2019年它還是實驗室裡需要專用擷取設備的原型,這次是第一次以消費級功能的形式進入具體產品的時程表。

通話對象看到的是一段生成影片

Hologram的運作方式和傳統視訊通話差異很大。根據UploadVR的實測報導,Ray-Ban Display版本的輸入只有眼鏡麥克風收到的音訊,Meta伺服器上即時運作的生成式擴散模型會依據這段音訊產生一路2D影片串流,再傳給通話另一端。使用者說話時的嘴形、神情、頭部動作,全都由模型從聲音推斷出來,鏡頭並不參與其中。

I let out a slight gasp at what I was seeing. It was entirely plausible.

UploadVR編輯David Heaney形容第一次看到Hologram時「忍不住倒抽一口氣」,畫面完全說得過去。

VR眼鏡版本的輸入更多:除了音訊,還會用上頭戴裝置的慣性感測器,以及鏡腳上朝下的臉部追蹤鏡頭,輸出一路帶遮罩、不含背景的立體影片。報導特別指出這仍是立體影片畫面,並非體積化的三維模型。

建模只要幾分鐘,衣著和背景會跟著固定

建立分身在手機的Meta AI App裡完成:依提示上下左右轉頭、露出笑容,再對幾道開放式問題做較長的回答,伺服器處理幾分鐘就能生成。

有個細節會影響日常使用。衣著和背景在建模當下就被固定進模型,Ray-Ban版本裡背景是靜止的,也就是說每次通話都穿同一套衣服、站在同一個背景前。Meta表示之後會加入用頭部轉動資料驅動、從鏡頭擷取動態背景、以文字提示換裝等功能,但時程尚未公布。

實測也暴露出明顯短板。Heaney提到眼睛等細節部位「會像低頻寬視訊通話一樣出現色塊」;在VR裡側身角度過大或走近對方時,分身會像早期遊戲裡的看板貼圖一樣整個轉動,臨場感當場破功。

蘋果、Google走的是另一條路

把幾家的做法放在一起比較,差異集中在「用什麼驅動這張臉」。

蘋果Vision Pro的Persona靠頭戴裝置內外的鏡頭即時追蹤臉部,分身動作和本人動作一一對應;Google Beam(前身為Project Starline)則用多鏡頭陣列重建真人的立體畫面,需要專用的顯示終端。兩者的共通點是盡量忠實還原鏡頭看到的畫面。

Hologram在眼鏡上走的是生成路線:只要聲音,其餘全交給模型補上。好處是硬體門檻低,一副沒有朝向自己鏡頭的眼鏡也能打「視訊電話」;代價則是對方看到的表情是模型的推斷結果,未必是本人當下真實的反應。Heaney在報導裡也提出疑問:親友是否願意在手機螢幕上看到一個合成版的你。

在隱私層面,報導並未寫明建模素材與通話音訊的保存與使用規則,Meta目前公開的資料裡,這部分也仍是空白。對台灣及其他中文使用者而言,Ray-Ban Display和WhatsApp都尚未在當地正式推出,Hologram短期內只能作為觀察海外AI視訊通話型態的樣本。

參考來源:UploadVR實測報導、CocoLoop、Engadget、IT之家;查核Hologram的輸入方式與伺服器端生成機制、Ray-Ban Display與Meta VR Glasses的上線時程及1299.99美元售價、建模流程。