Meta Hologram今秋上眼镜,靠声音驱动AI分身

Meta 在 Connect 2026 大会上公布了拟真虚拟形象 Hologram,并确定了上线路线:今年秋季先以早期体验的形式登陆 Ray-Ban Display 智能眼镜,用于美国地区的 WhatsApp 视频通话;全身版本随售价 1299.99 美元的 Meta VR Glasses 在 2027 年春季推出,之后扩展到 Quest 3。

这项功能背后的研究是 Meta 做了七年多的 Codec Avatars。2019 年它还是实验室里需要专门采集设备的原型,这次第一次以消费级功能的形式进入具体产品的时间表。

通话对象看到的是一段生成视频

Hologram 的工作方式和传统视频通话差别很大。按 UploadVR 的实测报道,Ray-Ban Display 版本的输入只有眼镜麦克风采集到的音频,Meta 服务器上的实时生成式扩散模型根据这段音频生成一路 2D 视频流,再发给通话另一端。用户说话时的口型、神态、头部动作,都由模型从声音里推断出来,摄像头不参与。

“I let out a slight gasp at what I was seeing. It was entirely plausible.”

UploadVR 编辑 David Heaney 描述第一次看到 Hologram 时”忍不住倒吸一口气”,画面完全说得过去。

VR 眼镜版本的输入更多:除了音频,还会用上头显的惯性传感器和镜腿上朝下的面部追踪摄像头,输出一路带遮罩、不含背景的立体视频。报道特别指出它仍是立体视频画面,不是体积化的三维模型。

建模几分钟,衣服和背景跟着固定

创建形象在手机上的 Meta AI 应用里完成:按提示上下左右转头、做出笑容,再对几道开放式问题做较长的回答,服务器处理几分钟即可生成。

有一个细节会影响日常使用。衣着和背景在建模时就被固定进模型,Ray-Ban 版本里背景是静态的,也就是说每次通话都穿同一身衣服、站在同一个背景前。Meta 称后续会加入用头部转动数据驱动、从摄像头采样动态背景、用文字提示换装等功能,时间表未公布。

实测的短板也很明显。Heaney 提到眼睛等细部”像低带宽视频通话一样出现色块”;在 VR 里侧身太多或者走近对方,形象会像老游戏里的公告板贴图一样整体转动,错觉当场破灭。

苹果、谷歌走的是另一条路

把几家的做法放在一起比,差异集中在”用什么驱动这张脸”。

苹果 Vision Pro 的 Persona 靠头显内外的摄像头实时追踪面部,形象动作和真人动作一一对应;谷歌 Beam(前身 Project Starline)用多摄像头阵列重建真人三维画面,需要专门的显示终端。两者的共同点是尽量忠实还原摄像头看到的东西。

Hologram 在眼镜上走的是生成路线:只要声音,其余交给模型补全。好处是硬件门槛低,一副没有朝向自己的摄像头的眼镜也能打”视频电话”;代价是对方看到的表情是模型的推断结果,未必是本人此刻的真实反应。Heaney 在报道里也提出了疑问:亲友是否愿意在手机屏幕上看到一个合成版本的你。

隐私层面,报道没有写明建模素材和通话音频的保存与使用规则。Meta 目前公开的材料里,这部分也还是空白。对国内用户来说,Ray-Ban Display 和 WhatsApp 都没有在国内正式提供,Hologram 短期内只能作为观察海外 AI 通话形态的样本。

参考来源:UploadVR 上手实测、CocoLoop、Engadget、IT之家;核验 Hologram 的输入方式与服务端生成机制、Ray-Ban Display 与 Meta VR Glasses 的上线节奏及 1299.99 美元售价、建模流程。