Google publie un modèle d'embedding multimodal open source de 740 millions de paramètres

Google a publié le 6 octobre EmbeddingGemma 2, un modèle d'embedding multimodal à poids ouverts. Il projette texte, code, images, images vidéo et audio dans le même espace vectoriel, pour une recherche locale sur smartphone et ordinateur portable sans que les données aient besoin de quitter l'appareil.

Le modèle s'appuie sur Gemma 4 et compte, dans sa version complète, environ 740 millions de paramètres, composés de trois blocs : un socle texte de 270 millions de paramètres, plus un encodeur visuel optionnel de 170 millions et un encodeur audio de 300 millions. Pour la seule recherche textuelle, le socle suffit. La licence Apache 2.0 autorise un usage commercial.

Caractéristiques techniques

La longueur de contexte est de 8 000 tokens. Selon la conversion officielle, une entrée peut contenir environ 5,5 minutes d'audio, 29 images ou 58 images vidéo.

La sortie est un vecteur de 768 dimensions, qui peut être tronqué à 512, 256 ou 128 dimensions. Cela repose sur l'apprentissage de représentations Matryoshka, où la perte de précision après troncature reste faible. Selon Google, le stockage et l'indexation locaux peuvent être réduits jusqu'à environ un sixième du volume d'origine (un autre passage du blog destiné aux développeurs évoque une réduction allant jusqu'à 8 fois).

L'empreinte sur l'appareil est le chiffre clé de cette version. Après quantification, sur un Pixel 11 Pro, la version texte seule occupe en fonctionnement environ 191 Mo de mémoire, et environ 567 Mo avec le mode multimodal entièrement activé. Sur le GPU M5 Pro d'un MacBook, le traitement d'une image prend environ 37,3 millisecondes, soit environ 27 images par seconde. Le modèle est proposé en versions quantifiées INT4 et INT8.

Côté benchmarks, sur le test de recherche de code MTEB Code, le modèle obtient 78,68 points, contre 68,76 pour la première génération, soit un gain de 9,92 points. Sur les benchmarks d'embedding d'images MIEB Lite et d'embedding audio MAEB, Google affirme être en tête parmi les modèles de taille comparable, mais l'annonce ne cite ni concurrents précis ni scores. En recherche de texte multilingue, les performances restent au niveau de la première génération.

Quelques démonstrations associées

L'application Google AI Edge Gallery (disponible sur Android et iOS) s'enrichit de deux nouvelles démonstrations : une recherche média instantanée, qui permet de retrouver des photos dans l'album à partir d'une phrase, et une recherche de moments vidéo, qui localise l'endroit où apparaît une scène précise. Sur Mac, un assistant de réunion nommé Foresight prend des notes en local et permet de rechercher aussi bien dans le texte que dans les enregistrements.

Les développeurs peuvent télécharger les poids depuis Hugging Face et Kaggle. LiteRT, MediaPipe, transformers.js, llama.cpp et Ollama le prennent déjà en charge, et le modèle peut tourner dans le navigateur via WebGPU. L'interface ML Kit pour Android doit arriver dans les prochaines semaines et exploitera alors le NPU du smartphone pour accélérer le traitement.

Pour les équipes de développement en Chine

La licence Apache 2.0, associée au support d'Ollama et de llama.cpp, permet aux équipes en Chine de télécharger directement le modèle pour des déploiements privés, utiles dans des scénarios sensibles à la fuite de données comme la recherche dans les albums photo, la recherche dans les enregistrements de réunions ou les bases de connaissances internes d'entreprise. La connexion directe à Hugging Face est instable en Chine, les téléchargements passent généralement par un miroir.

Les modèles d'embedding open source locaux ne manquent pas : un modèle d'embedding multimodal publié auparavant par l'équipe WeChat avait occupé la première place du classement MMEB-v2. La différence tient à la taille : EmbeddingGemma 2 a été conçu dès le départ en fonction de la mémoire des smartphones, et le chiffre de 567 Mo vise directement l'usage embarqué. Sur les performances en chinois, Google indique seulement que la capacité multilingue est au niveau de la première génération, sans fournir de score de recherche spécifique au chinois ; mieux vaut donc le tester avec son propre corpus avant de l'intégrer.

Sources : blog officiel de Google, CocoLoop, Google Developers Blog ; la page du modèle de Google DeepMind vérifie la composition des paramètres, la longueur de contexte et le score MTEB Code, le blog des développeurs vérifie la mémoire sur l'appareil et la vitesse de traitement des images.