Google開源7.4億參數多模態嵌入模型

Google於10月6日發布EmbeddingGemma 2,一款開放權重的多模態嵌入模型。它能將文字、程式碼、圖片、影片畫面與音訊映射到同一個向量空間,用途是在手機、筆電上做本機檢索,資料不必離開裝置。

模型以Gemma 4為基礎,完整版約7.4億參數,由三個部分組成:2.7億參數的文字骨幹模型,加上可選的1.7億參數視覺編碼器與3億參數音訊編碼器。若只做文字檢索,裝骨幹模型就夠用。授權條款為Apache 2.0,可商用。

規格

上下文長度為8K token。依官方換算,一次輸入大約能放進5.5分鐘音訊、29張圖片或58個影格的影片。

輸出為768維向量,可截成512、256或128維。這靠的是Matryoshka表示學習,截短後精度損失較小;官方表示本機儲存與索引最多能省到原本的六分之一左右(開發者部落格另一處則寫最多可達8倍)。

端側占用是這次的重點數字。量化後在Pixel 11 Pro上,純文字版本執行時約占191MB記憶體,多模態全開約567MB。在MacBook的M5 Pro GPU上,處理一張圖片約37.3毫秒,每秒約可處理27張。模型提供INT4與INT8兩種量化版本。

效能測試方面,程式碼檢索基準MTEB Code得分78.68,初代為68.76,提升9.92分。在圖片嵌入基準MIEB Lite與音訊嵌入基準MAEB上,Google表示領先同量級模型,但公告中並未列出具體對手與分數。多語言文字檢索則與初代持平。

配套的幾個示範

Google AI Edge Gallery應用程式(Android與iOS皆有)新增兩個示範:即時媒體搜尋,用一句話在相簿裡找圖;影片時刻搜尋,定位影片中某個畫面出現的位置。Mac上另有一款名為Foresight的會議助手,可在本機記筆記,還能跨文字記錄與錄音進行檢索。

開發者可從Hugging Face、Kaggle下載權重。LiteRT、MediaPipe、transformers.js、llama.cpp、Ollama皆已支援,在瀏覽器中也可透過WebGPU執行。Android的ML Kit介面將於未來幾週上線,屆時會呼叫手機的NPU進行加速。

對中國開發者而言

Apache 2.0授權加上Ollama、llama.cpp的支援,中國團隊可以直接拉取模型做私有化部署,相簿檢索、會議錄音檢索、企業內網知識庫這類對資料外流敏感的場景用得上。中國境內直連Hugging Face不穩定,下載通常得透過鏡像站。

中國本地同類開源模型並不少,先前微信團隊開源的多模態嵌入模型曾在MMEB-v2排行榜上排名第一。差別在於規模:EmbeddingGemma 2從一開始就按手機記憶體容量來設計,567MB這個數字就是衝著端側而來。中文效果方面,Google只表示多語言能力與初代持平,並未單獨公布中文檢索分數,導入前最好先拿自己的語料測一輪。

參考來源:Google官方部落格、CocoLoop、Google Developers Blog;Google DeepMind模型頁核實參數組成、上下文長度與MTEB Code分數,開發者部落格核實端側記憶體與圖片處理速度。