Lors de la Connect 2026, Meta a présenté Hologram, un avatar virtuel réaliste, et fixé sa feuille de route : dès cet automne, la fonction arrive en accès anticipé sur les lunettes connectées Ray-Ban Display, pour les appels vidéo WhatsApp aux États-Unis ; la version corps entier suivra au printemps 2027 avec les Meta VR Glasses, vendues 1 299,99 dollars, avant de s'étendre au Quest 3.
Cette fonction s'appuie sur les recherches menées depuis plus de sept ans par Meta sur les Codec Avatars. En 2019, ce n'était encore qu'un prototype de laboratoire nécessitant un équipement de capture dédié ; c'est la première fois que la technologie entre dans le calendrier d'un produit grand public concret.
L'interlocuteur voit une vidéo générée
Le fonctionnement d'Hologram diffère beaucoup d'un appel vidéo classique. Selon le test pratique d'UploadVR, la version Ray-Ban Display ne reçoit en entrée que l'audio capté par les micros des lunettes ; un modèle de diffusion génératif tournant en temps réel sur les serveurs de Meta produit à partir de cet audio un flux vidéo 2D envoyé à l'autre bout de l'appel. Le mouvement des lèvres, les expressions et les mouvements de tête de la personne qui parle sont tous déduits par le modèle à partir de la voix seule ; la caméra n'intervient pas dans ce processus.
"I let out a slight gasp at what I was seeing. It was entirely plausible."
David Heaney, rédacteur d'UploadVR, raconte qu'en découvrant Hologram pour la première fois, il n'a "pas pu retenir un petit sursaut" tant l'image lui a paru totalement plausible.
La version pour lunettes VR reçoit davantage de données en entrée : outre l'audio, elle utilise les capteurs inertiels du casque et une caméra de suivi facial orientée vers le bas sur les branches, pour produire un flux vidéo stéréoscopique masqué, sans arrière-plan. Le reportage souligne explicitement qu'il s'agit toujours d'une image vidéo stéréoscopique, pas d'un modèle 3D volumétrique.
Quelques minutes de modélisation, mais la tenue et le décor restent figés
La création de l'avatar se fait dans l'application Meta AI sur smartphone : on tourne la tête vers le haut, le bas, la gauche et la droite selon les instructions, on sourit, puis on répond assez longuement à quelques questions ouvertes ; le traitement côté serveur ne prend que quelques minutes.
Un détail affecte l'usage au quotidien : la tenue et l'arrière-plan sont figés dans le modèle dès la modélisation. Sur la version Ray-Ban, le fond est statique, ce qui signifie que l'on porte la même tenue devant le même décor à chaque appel. Meta indique vouloir ajouter par la suite des fonctions pilotées par les données de rotation de la tête, un échantillonnage de fonds dynamiques via la caméra, ou un changement de tenue par simple instruction textuelle, sans calendrier annoncé pour l'instant.
Les limites constatées lors du test sont également nettes. Heaney note que des détails comme les yeux "se pixellisent en blocs de couleur, comme lors d'un appel vidéo à faible bande passante" ; en VR, si l'on se tourne trop de côté ou que l'on s'approche trop de l'interlocuteur, l'avatar pivote d'un bloc comme un sprite de panneau publicitaire dans un vieux jeu vidéo, brisant l'illusion instantanément.
Apple et Google empruntent une autre voie
En comparant les approches des différents acteurs, la différence tient surtout à "ce qui pilote ce visage".
La Persona de l'Apple Vision Pro repose sur des caméras internes et externes au casque qui suivent le visage en temps réel, si bien que le mouvement de l'avatar correspond un à un au mouvement réel ; Google Beam (anciennement Project Starline) utilise une matrice de plusieurs caméras pour reconstruire une image 3D de la personne réelle, ce qui nécessite un terminal d'affichage dédié. Les deux approches ont en commun de chercher à reproduire aussi fidèlement que possible ce que voit la caméra.
Sur les lunettes, Hologram choisit la voie générative : seule la voix est nécessaire, le modèle comble le reste. L'avantage est une barrière matérielle basse — même des lunettes sans caméra tournée vers soi peuvent ainsi passer un "appel vidéo" ; le prix à payer est que l'expression vue par l'interlocuteur résulte d'une déduction du modèle, qui ne correspond pas forcément à la réaction réelle de la personne à cet instant. Heaney soulève lui aussi cette question dans son reportage : les proches voudront-ils vraiment voir une version synthétisée de vous sur l'écran de leur téléphone.
Côté confidentialité, le reportage ne précise pas les règles de conservation et d'utilisation des données de modélisation ni de l'audio des appels. Dans les documents publics actuels de Meta, ce point reste également flou. Pour les utilisateurs en Chine, ni Ray-Ban Display ni WhatsApp ne sont officiellement disponibles, si bien qu'Hologram ne peut pour l'instant servir que d'exemple pour observer comment les appels dopés à l'IA évoluent à l'étranger.
Sources : test pratique d'UploadVR, CocoLoop, Engadget, IT Home ; vérifiés : le mode de saisie et le mécanisme de génération côté serveur d'Hologram, le calendrier de lancement de Ray-Ban Display et Meta VR Glasses ainsi que le prix de 1 299,99 dollars, et le processus de modélisation.