Em 6 de outubro, o Google lançou o EmbeddingGemma 2, um modelo de embedding multimodal com pesos abertos. Ele mapeia texto, código, imagens, quadros de vídeo e áudio para o mesmo espaço vetorial, destinado a buscas locais em smartphones e laptops sem que os dados precisem deixar o dispositivo.
O modelo é construído sobre o Gemma 4 e, na versão completa, tem cerca de 740 milhões de parâmetros, formados por três partes: um núcleo de texto de 270 milhões, mais um codificador de visão opcional de 170 milhões e um codificador de áudio de 300 milhões. Para busca apenas de texto, basta instalar o núcleo. A licença Apache 2.0 permite uso comercial.
Especificações
O comprimento de contexto é de 8K tokens. Segundo a conversão oficial, uma entrada pode conter cerca de 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo.
A saída é um vetor de 768 dimensões, que pode ser truncado para 512, 256 ou 128. Isso se baseia no aprendizado de representações Matryoshka, em que a perda de precisão após o truncamento é pequena. Segundo o Google, o armazenamento e a indexação locais podem ser reduzidos a cerca de um sexto do tamanho original (outro trecho do blog para desenvolvedores menciona redução de até 8 vezes).
O consumo no dispositivo é o número central desta versão. Após a quantização, em um Pixel 11 Pro, a versão apenas de texto ocupa cerca de 191MB de memória em execução, e com o modo multimodal totalmente ativado, cerca de 567MB. Na GPU M5 Pro de um MacBook, processar uma imagem leva cerca de 37,3 milissegundos, o equivalente a cerca de 27 imagens por segundo. O modelo está disponível em versões quantizadas INT4 e INT8.
Nos benchmarks, no teste de busca de código MTEB Code o modelo alcança 78,68 pontos, contra 68,76 da primeira geração, um ganho de 9,92 pontos. Nos benchmarks de embedding de imagem MIEB Lite e de embedding de áudio MAEB, o Google afirma liderar entre modelos de tamanho semelhante, mas o anúncio não lista concorrentes específicos nem pontuações. Na busca de texto multilíngue, o desempenho fica no mesmo nível da primeira geração.
Algumas demos que acompanham o lançamento
O aplicativo Google AI Edge Gallery (disponível em Android e iOS) ganhou duas novas demos: busca instantânea de mídia, que permite encontrar fotos no álbum com uma frase, e busca de momentos em vídeo, que localiza em que ponto uma determinada cena aparece. No Mac, há ainda um assistente de reuniões chamado Foresight, que faz anotações localmente e permite buscar tanto em texto quanto em gravações.
Desenvolvedores podem baixar os pesos no Hugging Face e no Kaggle. LiteRT, MediaPipe, transformers.js, llama.cpp e Ollama já oferecem suporte, e o modelo pode ser executado no navegador via WebGPU. A interface ML Kit para Android deve chegar nas próximas semanas e, então, usará a NPU do smartphone para acelerar o processamento.
Para equipes de desenvolvimento na China
A licença Apache 2.0, somada ao suporte de Ollama e llama.cpp, permite que equipes na China baixem o modelo diretamente para implantações privadas, úteis em cenários sensíveis à saída de dados, como busca em álbuns de fotos, busca em gravações de reuniões ou bases de conhecimento internas de empresas. A conexão direta com o Hugging Face é instável na China, e os downloads geralmente precisam passar por um espelho.
Modelos de embedding de código aberto locais não faltam: um modelo de embedding multimodal lançado anteriormente pela equipe do WeChat já ocupou o primeiro lugar no ranking MMEB-v2. A diferença está no tamanho: o EmbeddingGemma 2 foi projetado desde o início em função da memória dos smartphones, e o número de 567MB é voltado diretamente para uso no dispositivo. Sobre o desempenho em chinês, o Google apenas informa que a capacidade multilíngue está no mesmo nível da primeira geração, sem apresentar uma pontuação específica de busca em chinês, por isso vale testar com o próprio corpus antes de integrar.
Fontes: blog oficial do Google, CocoLoop, Google Developers Blog; a página do modelo do Google DeepMind confirma a composição de parâmetros, o comprimento de contexto e a pontuação MTEB Code, e o blog para desenvolvedores confirma a memória no dispositivo e a velocidade de processamento de imagens.