腾讯微信视觉团队开源了 WeMM-Embedding,一组通用多模态嵌入模型,代码和权重同时挂上 GitHub 与 Hugging Face,技术报告编号 arXiv 2608.24053,代码部分采用 Apache 2.0 协议。
嵌入模型干的活是把内容压成一串向量,让相似的东西在向量空间里挨得近,检索、去重、推荐都靠它撑着。WeMM-Embedding 的覆盖面比多数同类要宽:文本、图像、视频、视觉文档,以及这几种任意交错混排的输入,全部走同一套表示。音频暂时不支持。
三档尺寸与榜单成绩
系列给了 2B、4B、9B 三个规格。在 MMEB-v2 的 78 个数据集上,2B 综合 77.9 分(图像 79.6、视频 70.8、视觉文档 80.7),4B 拿到 79.2,9B 是 80.6,排在官方榜单第一,压过所有已列出的开源与闭源模型。
横向比更能看出位置。2B 版本比 Qwen3-VL-Embedding-2B 高 4.7 分、比 DME-2B 高 3.1 分,同时略微超过参数量四倍的 Qwen3-VL-Embedding-8B。训练配方和数据质量的权重,在这类任务里已经压过了单纯的参数规模。
训练分两段走:先做大规模多模态对齐,再用精选数据做精修,精修阶段加了细粒度相关性监督和跨尺度知识迁移——大模型学到的东西往小模型上导,这也是 2B 能越级的一个来源。
维度可以砍
三个规格都支持 Matryoshka 表示,输出维度从 64 一路可选到 2048 或 4096。官方给的数字是:在 MMEB-v2 上取 256 维,图像和视频任务仍能保住全维度 98.7% 的效果。
这条对工程侧的分量比榜单大。向量库的存储和检索开销跟维度基本成正比,2048 维砍到 256 维,索引体积掉到八分之一,召回阶段的距离计算也跟着降。以往要做这件事得单独训个小模型或者外挂降维层,现在同一份权重取前几段就行。实现上,嵌入取自最后一层 <embedding> 专用 token 位置的隐状态,再做 L2 归一化。
已经在跑线上流量
技术报告里提到一个内部 26 项任务的评测集,以及微信各业务上的 14 组线上 A/B 实验,都拿到了一致提升。这类数字外部无法复现,但它说明模型没有停在刷榜层面——微信的搜一搜、视频号、公众号内容检索,量级本身就是压力测试。
限制写得也清楚:不支持音频输入,评测代码里视频按 64 帧采样。要处理长视频或者音画联合检索的场景,还得自己补一层。
对国内做多模态 RAG 的团队来说,2B 这一档的可用性比 9B 登顶更有分量。粗算一下,2B 模型配 256 维输出,单卡就能跑起千万级的图文索引,成本结构和过去挂闭源 API 完全不是一回事。Apache 2.0 的代码协议也把商用门槛压得很低。
参考来源:Tencent/WeMM-Embedding 开源仓库、arXiv 技术报告 2608.24053、Hugging Face 模型页、CocoLoop;MMEB-v2 各档分数、Matryoshka 维度区间与线上 A/B 实验组数以官方仓库与技术报告口径为准。