Google veröffentlicht multimodales Embedding-Modell mit 740 Mio. Parametern als Open Source

Google hat am 6. Oktober EmbeddingGemma 2 veröffentlicht, ein multimodales Embedding-Modell mit offenen Gewichten. Es bildet Text, Code, Bilder, Videobilder und Audio auf denselben Vektorraum ab und ist für die lokale Suche auf Smartphones und Laptops gedacht, ohne dass Daten das Gerät verlassen müssen.

Das Modell basiert auf Gemma 4 und hat in der vollständigen Version rund 740 Millionen Parameter, zusammengesetzt aus drei Teilen: einem Text-Backbone mit 270 Millionen Parametern plus einem optionalen Bild-Encoder mit 170 Millionen und einem Audio-Encoder mit 300 Millionen Parametern. Für reine Textsuche reicht das Backbone allein aus. Die Lizenz ist Apache 2.0 und erlaubt kommerzielle Nutzung.

Spezifikationen

Die Kontextlänge beträgt 8K Token. Laut offizieller Umrechnung passen in eine Eingabe etwa 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes.

Die Ausgabe ist ein 768-dimensionaler Vektor, der sich auf 512, 256 oder 128 Dimensionen kürzen lässt. Das basiert auf Matryoshka Representation Learning, bei dem der Genauigkeitsverlust nach dem Kürzen gering ausfällt. Laut Google lassen sich lokale Speicherung und Indexierung um bis zu etwa das Sechsfache reduzieren (an anderer Stelle im Entwickler-Blog ist von bis zum Achtfachen die Rede).

Der Speicherbedarf auf dem Gerät ist diesmal die zentrale Kennzahl. Quantisiert belegt die reine Textversion auf einem Pixel 11 Pro beim Laufen rund 191 MB Speicher, bei voll aktivierter Multimodalität sind es etwa 567 MB. Auf der M5-Pro-GPU eines MacBooks dauert die Verarbeitung eines Bildes rund 37,3 Millisekunden, was etwa 27 Bildern pro Sekunde entspricht. Das Modell gibt es in INT4- und INT8-quantisierten Versionen.

Bei den Benchmarks erreicht das Modell im Code-Suchtest MTEB Code 78,68 Punkte, gegenüber 68,76 bei der ersten Generation, ein Plus von 9,92 Punkten. Bei den Benchmarks für Bild-Embeddings (MIEB Lite) und Audio-Embeddings (MAEB) sieht sich Google nach eigenen Angaben an der Spitze der Modelle vergleichbarer Größe, nennt in der Ankündigung aber keine konkreten Konkurrenten oder Werte. Bei der mehrsprachigen Textsuche liegt es auf dem Niveau der ersten Generation.

Ein paar begleitende Demos

Die App Google AI Edge Gallery (für Android und iOS) bekommt zwei neue Demos: eine Sofort-Mediensuche, mit der sich per Satz Fotos im Album finden lassen, und eine Video-Momentsuche, die die Stelle eines bestimmten Bildes im Video findet. Auf dem Mac gibt es zudem einen Meeting-Assistenten namens Foresight, der lokal Notizen führt und sich sowohl über Text als auch über Aufnahmen durchsuchen lässt.

Entwickler können die Gewichte von Hugging Face oder Kaggle herunterladen. LiteRT, MediaPipe, transformers.js, llama.cpp und Ollama unterstützen das Modell bereits, im Browser lässt es sich über WebGPU ausführen. Die ML-Kit-Schnittstelle für Android soll in den kommenden Wochen folgen und dann die NPU des Smartphones zur Beschleunigung nutzen.

Für Entwicklerteams in China

Apache 2.0 in Kombination mit Unterstützung durch Ollama und llama.cpp erlaubt es Teams in China, das Modell direkt herunterzuladen und privat zu betreiben – nützlich für Szenarien wie Fotosuche, die Durchsuchung von Meeting-Aufnahmen oder unternehmensinterne Wissensdatenbanken, bei denen das Abfließen von Daten heikel ist. Die direkte Verbindung zu Hugging Face ist in China instabil, Downloads laufen meist über einen Spiegel-Server.

An heimischen Open-Source-Alternativen mangelt es nicht: Ein zuvor vom WeChat-Team veröffentlichtes multimodales Embedding-Modell stand bereits an der Spitze des MMEB-v2-Rankings. Der Unterschied liegt in der Größe: EmbeddingGemma 2 wurde von Anfang an auf den Speicherbedarf von Smartphones ausgelegt, die 567 MB sind gezielt auf On-Device-Einsatz ausgerichtet. Zur Leistung mit chinesischsprachigem Text sagt Google lediglich, die mehrsprachige Fähigkeit liege auf dem Niveau der ersten Generation, einen eigenen Wert für die chinesische Suche nennt das Unternehmen nicht – vor der Integration lohnt sich daher ein eigener Test mit dem eigenen Textkorpus.

Quellen: offizieller Google-Blog, CocoLoop, Google Developers Blog; die Modellseite von Google DeepMind bestätigt Parameteraufbau, Kontextlänge und MTEB-Code-Wert, der Entwickler-Blog bestätigt Speicherbedarf auf dem Gerät und Bildverarbeitungsgeschwindigkeit.