騰訊微信視覺團隊開源了 WeMM-Embedding,一組通用多模態嵌入模型,程式碼和權重同時上架 GitHub 與 Hugging Face,技術報告編號 arXiv 2608.24053,程式碼部分採用 Apache 2.0 授權條款。
嵌入模型的工作是把內容壓縮成一串向量,讓相似的東西在向量空間裡靠得更近,檢索、去重複、推薦都靠它撐著。WeMM-Embedding 涵蓋的範圍比多數同類產品更廣:文字、圖片、影片、視覺文件,以及這幾種任意交錯混合的輸入,全部走同一套表示方式。目前還不支援音訊。
三種規格,登頂排行榜
系列提供 2B、4B、9B 三種規格。在 MMEB-v2 的 78 個資料集上,2B 綜合得分 77.9(圖片 79.6、影片 70.8、視覺文件 80.7),4B 拿到 79.2,9B 則是 80.6,排在官方排行榜第一,超越所有已列出的開源與閉源模型。
橫向比較更能看出其位置。2B 版本比 Qwen3-VL-Embedding-2B 高 4.7 分、比 DME-2B 高 3.1 分,同時略微超過參數量四倍的 Qwen3-VL-Embedding-8B。訓練配方和資料品質的重要性,在這類任務裡已經蓋過了單純的參數規模。
訓練分兩階段進行:先做大規模多模態對齊,再用精選資料做精修,精修階段加入細粒度相關性監督與跨規模知識轉移——讓大模型學到的東西往小模型上導入,這也是 2B 能越級表現的原因之一。
維度可以砍
三種規格都支援 Matryoshka 表示法,輸出維度從 64 一路可選到 2048 或 4096。官方數據顯示:在 MMEB-v2 上取 256 維,圖片與影片任務仍能保住全維度 98.7% 的效果。
這一點對工程端的意義比排行榜更大。向量資料庫的儲存與檢索開銷大致跟維度成正比,從 2048 維砍到 256 維,索引體積掉到八分之一,召回階段的距離計算量也跟著下降。過去要做到這件事,得另外訓練一個小模型或外掛降維層,現在同一份權重取前幾段就能用。實作上,嵌入取自最後一層專用 <embedding> token 位置的隱狀態,再做 L2 正規化。
已經在線上流量中運作
技術報告提到一個內部 26 項任務的評測集,以及微信各業務線上的 14 組 A/B 測試,都拿到一致的提升。這類數字外部無法重現,但說明模型並沒有停留在刷榜層次——微信的搜一搜、視頻號、公眾號內容檢索,本身的量級就是一場壓力測試。
限制也寫得很清楚:不支援音訊輸入,評測程式碼裡影片是以 64 幀取樣。要處理長影片或音訊與影像聯合檢索的場景,還得自己再補一層。
對中國大陸從事多模態 RAG 的團隊來說,2B 這一檔的可用性比 9B 登頂更有分量。粗估一下,2B 模型搭配 256 維輸出,單張顯示卡就能跑起千萬級的圖文索引,成本結構和過去掛閉源 API 完全不是一回事。Apache 2.0 的程式碼授權也把商用門檻壓得很低。
參考來源:Tencent/WeMM-Embedding 開源儲存庫、arXiv 技術報告 2608.24053、Hugging Face 模型頁面、CocoLoop;MMEB-v2 各檔分數、Matryoshka 維度區間與線上 A/B 實驗組數,以官方儲存庫與技術報告為準。