A equipe de Visão do WeChat, da Tencent, abriu o código do WeMM-Embedding, um conjunto de modelos de embedding multimodal de uso geral. Código e pesos foram publicados simultaneamente no GitHub e no Hugging Face, o relatório técnico tem o número arXiv 2608.24053, e a parte de código usa a licença Apache 2.0.
O trabalho de um modelo de embedding é comprimir conteúdo em uma sequência de vetores, fazendo com que itens semelhantes fiquem próximos no espaço vetorial — é nisso que se apoiam busca, deduplicação e recomendação. A cobertura do WeMM-Embedding é mais ampla que a da maioria dos modelos semelhantes: texto, imagem, vídeo, documentos visuais e combinações intercaladas livremente entre esses formatos, tudo processado pela mesma representação. Áudio ainda não é suportado.
Três tamanhos e resultados no ranking
A série vem em três tamanhos: 2B, 4B e 9B. Nos 78 conjuntos de dados do MMEB-v2, a versão 2B obteve pontuação geral de 77,9 (imagem 79,6, vídeo 70,8, documentos visuais 80,7), a 4B alcançou 79,2 e a 9B chegou a 80,6, ficando em primeiro lugar no ranking oficial, à frente de todos os modelos abertos e fechados já listados.
A comparação direta deixa a posição ainda mais clara. A versão 2B fica 4,7 pontos acima do Qwen3-VL-Embedding-2B e 3,1 pontos acima do DME-2B, além de superar ligeiramente o Qwen3-VL-Embedding-8B, que tem quatro vezes mais parâmetros. Nesse tipo de tarefa, o peso da receita de treinamento e da qualidade dos dados já supera o simples tamanho do modelo.
O treinamento é feito em duas etapas: primeiro um alinhamento multimodal em grande escala, depois um refinamento com dados selecionados. Na etapa de refinamento, foram adicionadas supervisão de relevância em granularidade fina e transferência de conhecimento entre escalas — o que o modelo grande aprende é repassado ao modelo pequeno, o que também explica como a versão 2B consegue superar modelos maiores.
As dimensões podem ser cortadas
Os três tamanhos suportam representação Matryoshka, com a dimensão de saída podendo variar de 64 até 2048 ou 4096. Segundo os números oficiais, ao usar 256 dimensões no MMEB-v2, as tarefas de imagem e vídeo ainda mantêm 98,7% do desempenho da dimensão completa.
Isso pesa mais para o lado da engenharia do que para o ranking. O custo de armazenamento e busca de um banco de vetores é basicamente proporcional à dimensão: cortar de 2048 para 256 dimensões reduz o tamanho do índice a um oitavo, e o cálculo de distância na etapa de recuperação também cai na mesma proporção. Antes, para conseguir isso era preciso treinar um modelo menor à parte ou acoplar uma camada extra de redução de dimensão; agora basta pegar os primeiros segmentos dos mesmos pesos. Na implementação, o embedding é extraído do estado oculto na posição do token dedicado <embedding> na última camada, seguido de normalização L2.
Já rodando em tráfego real
O relatório técnico menciona um conjunto interno de avaliação com 26 tarefas, além de 14 experimentos A/B em produção em diferentes serviços do WeChat, todos com melhorias consistentes. Esses números não podem ser reproduzidos externamente, mas indicam que o modelo não parou apenas na disputa por posições no ranking — a busca Sou Yisou, os Channels (canais de vídeo) e a busca de conteúdo dos Official Accounts do WeChat já representam, pelo próprio volume, um teste de estresse.
As limitações também estão claras: não há suporte a entrada de áudio, e no código de avaliação os vídeos são amostrados a 64 quadros. Para lidar com vídeos longos ou busca combinada de áudio e imagem, ainda é preciso adicionar uma camada própria.
Para equipes chinesas que trabalham com RAG multimodal, a usabilidade da versão 2B pesa mais do que o primeiro lugar da 9B. Em números aproximados, o modelo 2B com saída de 256 dimensões consegue rodar um índice de imagem e texto na casa das dezenas de milhões em uma única GPU, com uma estrutura de custo completamente diferente de depender de APIs fechadas como antes. A licença Apache 2.0 também derruba bastante a barreira para uso comercial.
Fontes: repositório de código aberto Tencent/WeMM-Embedding, relatório técnico arXiv 2608.24053, página do modelo no Hugging Face, CocoLoop; as pontuações de cada versão no MMEB-v2, a faixa de dimensões Matryoshka e o número de experimentos A/B em produção seguem o repositório oficial e o relatório técnico.