Das WeChat-Vision-Team von Tencent hat WeMM-Embedding quelloffen veröffentlicht, eine Reihe universeller multimodaler Embedding-Modelle. Code und Gewichte stehen gleichzeitig auf GitHub und Hugging Face, der technische Bericht trägt die Nummer arXiv 2608.24053, der Code steht unter der Apache-2.0-Lizenz.
Ein Embedding-Modell komprimiert Inhalte zu einer Reihe von Vektoren, sodass Ähnliches im Vektorraum nah beieinanderliegt – darauf stützen sich Suche, Deduplizierung und Empfehlungen. WeMM-Embedding deckt mehr ab als die meisten vergleichbaren Modelle: Text, Bilder, Videos, visuelle Dokumente sowie beliebig gemischte Kombinationen dieser Eingaben laufen alle über dieselbe Repräsentation. Audio wird vorerst nicht unterstützt.
Drei Größen und Bestenlisten-Ergebnisse
Die Reihe umfasst drei Größen: 2B, 4B und 9B. Auf den 78 Datensätzen von MMEB-v2 erreicht die 2B-Version einen Gesamtwert von 77,9 (Bild 79,6, Video 70,8, visuelle Dokumente 80,7), die 4B-Version kommt auf 79,2 und die 9B-Version auf 80,6 – Platz eins in der offiziellen Rangliste, vor allen bisher gelisteten Open-Source- und proprietären Modellen.
Im direkten Vergleich zeigt sich die Position noch deutlicher. Die 2B-Version liegt 4,7 Punkte über Qwen3-VL-Embedding-2B und 3,1 Punkte über DME-2B und übertrifft zugleich leicht das viermal so große Qwen3-VL-Embedding-8B. Das Gewicht von Trainingsrezept und Datenqualität hat bei dieser Art Aufgabe die reine Parametergröße bereits übertroffen.
Das Training läuft in zwei Phasen: zunächst eine groß angelegte multimodale Ausrichtung, danach eine Feinabstimmung mit ausgewählten Daten. In der Feinabstimmungsphase kommen eine feingranulare Relevanzüberwachung und ein Wissenstransfer über Modellgrößen hinweg hinzu – Wissen aus dem großen Modell wird auf das kleine übertragen, was mit ein Grund dafür ist, dass die 2B-Version über ihrer Gewichtsklasse spielt.
Dimensionen lassen sich kürzen
Alle drei Größen unterstützen die Matryoshka-Repräsentation, bei der die Ausgabedimension von 64 bis hinauf zu 2048 oder 4096 wählbar ist. Laut offiziellen Angaben behalten Bild- und Videoaufgaben bei 256 Dimensionen auf MMEB-v2 noch 98,7 Prozent der Leistung der vollen Dimension.
Das wiegt für die technische Umsetzung schwerer als die Rangliste. Speicher- und Abfragekosten einer Vektordatenbank steigen im Wesentlichen proportional zur Dimension: Eine Reduktion von 2048 auf 256 Dimensionen verkleinert den Indexumfang auf ein Achtel, und auch die Distanzberechnung in der Retrieval-Phase sinkt entsprechend. Früher musste man dafür eigens ein kleineres Modell trainieren oder eine zusätzliche Dimensionsreduktionsschicht vorschalten – jetzt genügt es, aus denselben Gewichten die ersten Segmente zu nehmen. Technisch wird das Embedding aus dem versteckten Zustand an der Position des dedizierten <embedding>-Tokens in der letzten Schicht entnommen und anschließend L2-normalisiert.
Bereits im Live-Traffic im Einsatz
Der technische Bericht erwähnt ein internes Evaluationsset mit 26 Aufgaben sowie 14 Online-A/B-Tests über verschiedene WeChat-Dienste hinweg, die durchweg konsistente Verbesserungen zeigten. Solche Zahlen lassen sich von außen nicht nachprüfen, sie deuten aber darauf hin, dass das Modell nicht bei der reinen Ranglisten-Optimierung stehen bleibt – die Suchfunktion Sou Yisou, Channels (Video-Kanäle) und die Inhaltssuche der Official Accounts von WeChat sind allein durch ihr Volumen bereits ein Belastungstest.
Auch die Einschränkungen sind klar benannt: Audioeingaben werden nicht unterstützt, im Evaluationscode werden Videos mit 64 Frames abgetastet. Für lange Videos oder eine kombinierte Audio-Bild-Suche muss noch eine eigene Schicht ergänzt werden.
Für Teams in China, die an multimodalem RAG arbeiten, zählt die Praxistauglichkeit der 2B-Größe mehr als der Spitzenplatz der 9B-Version. Grob gerechnet lässt sich mit dem 2B-Modell und 256-dimensionaler Ausgabe auf einer einzelnen GPU ein Bild-Text-Index im Bereich von zig Millionen Einträgen betreiben – eine völlig andere Kostenstruktur als das bisherige Anbinden proprietärer APIs. Die Apache-2.0-Lizenz senkt zudem die Hürde für die kommerzielle Nutzung deutlich.
Quellen: Tencent/WeMM-Embedding-Repository, technischer Bericht arXiv 2608.24053, Hugging-Face-Modellseite, CocoLoop; die Werte der einzelnen Modellgrößen auf MMEB-v2, der Matryoshka-Dimensionsbereich und die Anzahl der Online-A/B-Tests folgen den Angaben im offiziellen Repository und im technischen Bericht.