Google libera modelo de embedding multimodal de 740 millones de parámetros

Google presentó el 6 de octubre EmbeddingGemma 2, un modelo de embedding multimodal de pesos abiertos. Es capaz de mapear texto, código, imágenes, fotogramas de video y audio en el mismo espacio vectorial, pensado para búsquedas locales en teléfonos y portátiles sin que los datos salgan del dispositivo.

El modelo está construido sobre Gemma 4 y, en su versión completa, tiene unos 740 millones de parámetros, formados por tres piezas: un núcleo de texto de 270 millones, más un codificador de visión opcional de 170 millones y un codificador de audio de 300 millones. Si solo se necesita búsqueda de texto, basta con instalar el núcleo. La licencia Apache 2.0 permite uso comercial.

Especificaciones

La longitud de contexto es de 8K tokens. Según la conversión oficial, una entrada puede contener aproximadamente 5,5 minutos de audio, 29 imágenes o 58 fotogramas de video.

La salida es un vector de 768 dimensiones que puede truncarse a 512, 256 o 128. Esto se apoya en el aprendizaje de representaciones Matryoshka, con el que la pérdida de precisión tras el truncado es pequeña. Google afirma que el almacenamiento e indexación locales pueden reducirse hasta aproximadamente una sexta parte del original (otro apartado del blog para desarrolladores habla de hasta 8 veces menos).

El consumo en el dispositivo es el dato clave de esta versión. Tras la cuantización, en un Pixel 11 Pro la versión solo de texto ocupa en ejecución unos 191MB de memoria, y con todo el modo multimodal activado, unos 567MB. En la GPU M5 Pro de un MacBook, procesar una imagen toma unos 37,3 milisegundos, alrededor de 27 imágenes por segundo. El modelo ofrece versiones cuantizadas INT4 e INT8.

En cuanto a resultados, en el benchmark de búsqueda de código MTEB Code obtiene 78,68 puntos, frente a los 68,76 de la primera generación, una mejora de 9,92 puntos. En los benchmarks de embedding de imágenes MIEB Lite y de audio MAEB, Google asegura que lidera entre los modelos de tamaño similar, aunque el anuncio no detalla competidores concretos ni puntuaciones. En búsqueda de texto multilingüe se mantiene al nivel de la primera generación.

Algunas demos que lo acompañan

La aplicación Google AI Edge Gallery (disponible en Android e iOS) suma dos nuevas demos: búsqueda instantánea de contenido multimedia, que permite encontrar fotos en el álbum con una frase, y búsqueda de momentos en video, que localiza en qué punto aparece una escena concreta. En Mac hay además un asistente de reuniones llamado Foresight, que toma notas en local y permite buscar tanto en el texto como en las grabaciones.

Los desarrolladores pueden descargar los pesos desde Hugging Face y Kaggle. LiteRT, MediaPipe, transformers.js, llama.cpp y Ollama ya lo soportan, y puede ejecutarse en el navegador mediante WebGPU. La interfaz ML Kit para Android llegará en las próximas semanas y entonces aprovechará la NPU del teléfono para acelerar el procesamiento.

Para los equipos de desarrollo en China

La licencia Apache 2.0, sumada al soporte de Ollama y llama.cpp, permite a los equipos en China descargarlo directamente para despliegues privados, útil en escenarios sensibles a la salida de datos como la búsqueda en álbumes de fotos, la búsqueda en grabaciones de reuniones o bases de conocimiento internas de empresas. La conexión directa a Hugging Face es inestable en China, por lo que las descargas suelen hacerse a través de un espejo.

Los modelos de embedding de código abierto locales no escasean: un modelo de embedding multimodal publicado antes por el equipo de WeChat llegó a ocupar el primer puesto en la clasificación MMEB-v2. La diferencia está en el tamaño: EmbeddingGemma 2 se diseñó desde el principio en función de la memoria de los teléfonos, y la cifra de 567MB apunta directamente al uso en el dispositivo. Sobre el rendimiento en chino, Google solo indica que la capacidad multilingüe está al nivel de la primera generación, sin ofrecer una puntuación específica de búsqueda en chino, por lo que conviene probarlo primero con el propio corpus antes de integrarlo.

Fuentes: blog oficial de Google, CocoLoop, Google Developers Blog; la página del modelo de Google DeepMind verifica la composición de parámetros, la longitud de contexto y la puntuación MTEB Code, y el blog para desarrolladores verifica la memoria en el dispositivo y la velocidad de procesamiento de imágenes.