WeChat libera modelo de embedding multimodal y lidera el MMEB-v2

El equipo de Visión de WeChat, de Tencent, liberó el código de WeMM-Embedding, un conjunto de modelos de embedding multimodal de propósito general. El código y los pesos se publicaron a la vez en GitHub y Hugging Face, el informe técnico lleva el número arXiv 2608.24053, y la parte de código usa la licencia Apache 2.0.

El trabajo de un modelo de embedding consiste en comprimir el contenido en una secuencia de vectores, de modo que las cosas parecidas queden cerca en el espacio vectorial; de ahí dependen la búsqueda, la deduplicación y las recomendaciones. La cobertura de WeMM-Embedding es más amplia que la de la mayoría de sus equivalentes: texto, imagen, video, documentos visuales, y cualquier combinación intercalada de estos formatos, todo bajo la misma representación. El audio, por ahora, no es compatible.

Tres tamaños y resultados en el ranking

La serie ofrece tres tamaños: 2B, 4B y 9B. En los 78 conjuntos de datos de MMEB-v2, la versión 2B obtuvo una puntuación global de 77,9 (imagen 79,6, video 70,8, documentos visuales 80,7), la 4B alcanzó 79,2 y la 9B llegó a 80,6, ocupando el primer puesto del ranking oficial, por delante de todos los modelos abiertos y cerrados ya listados.

La comparación directa deja más clara su posición. La versión 2B supera al Qwen3-VL-Embedding-2B por 4,7 puntos y al DME-2B por 3,1 puntos, además de superar ligeramente al Qwen3-VL-Embedding-8B, que tiene cuatro veces más parámetros. En este tipo de tareas, el peso de la receta de entrenamiento y la calidad de los datos ya supera al simple tamaño del modelo.

El entrenamiento se hace en dos etapas: primero una alineación multimodal a gran escala, y después un ajuste fino con datos seleccionados. En la etapa de ajuste fino se añadió supervisión de relevancia de grano fino y transferencia de conocimiento entre escalas: lo que aprende el modelo grande se traslada al modelo pequeño, lo que también explica en parte cómo el 2B logra superar a modelos mayores.

Las dimensiones se pueden recortar

Los tres tamaños admiten la representación Matryoshka, con una dimensión de salida que puede elegirse desde 64 hasta 2048 o 4096. Según las cifras oficiales, al usar 256 dimensiones en MMEB-v2, las tareas de imagen y video mantienen el 98,7% del rendimiento respecto a la dimensión completa.

Esto pesa más para la ingeniería que para el ranking. El costo de almacenamiento y búsqueda de una base de datos vectorial es prácticamente proporcional a la dimensión: reducir de 2048 a 256 dimensiones baja el tamaño del índice a un octavo, y el cálculo de distancias en la fase de recuperación baja en la misma proporción. Antes, para lograr esto había que entrenar un modelo pequeño aparte o añadir una capa de reducción de dimensión; ahora basta con tomar los primeros segmentos de los mismos pesos. A nivel de implementación, el embedding se extrae del estado oculto en la posición del token dedicado <embedding> de la última capa, y luego se normaliza con L2.

Ya funciona con tráfico real

El informe técnico menciona un conjunto de evaluación interno con 26 tareas, además de 14 experimentos A/B en producción en distintos servicios de WeChat, todos con mejoras consistentes. Estas cifras no se pueden verificar desde fuera, pero indican que el modelo no se quedó solo en la competencia por el ranking: la búsqueda Sou Yisou, los Channels (canales de video) y la búsqueda de contenido de las Official Accounts de WeChat ya suponen, por su propio volumen, una prueba de estrés.

Las limitaciones también están claras: no admite entrada de audio, y en el código de evaluación los videos se muestrean a 64 fotogramas. Para procesar videos largos o escenarios de recuperación combinada de audio e imagen, todavía hay que añadir una capa propia.

Para los equipos chinos que trabajan en RAG multimodal, la utilidad de la versión de 2B pesa más que el primer puesto de la 9B. A grandes rasgos, el modelo 2B con salida de 256 dimensiones puede hacer funcionar un índice de imagen y texto del orden de decenas de millones con una sola GPU, con una estructura de costos completamente distinta a depender de APIs cerradas como antes. La licencia Apache 2.0 también reduce mucho la barrera para el uso comercial.

Fuentes: repositorio de código abierto Tencent/WeMM-Embedding, informe técnico arXiv 2608.24053, página del modelo en Hugging Face, CocoLoop; las puntuaciones de cada tamaño en MMEB-v2, el rango de dimensiones Matryoshka y el número de experimentos A/B en producción siguen el repositorio oficial y el informe técnico.