Google 10 月 6 日发布 EmbeddingGemma 2,一个开放权重的多模态嵌入模型。它能把文本、代码、图像、视频帧和音频映射到同一个向量空间,用途是在手机、笔记本上做本地检索,数据不用出设备。
模型基于 Gemma 4,完整版约 7.4 亿参数,由三块拼成:2.7 亿参数的文本主干,加上可选的 1.7 亿参数视觉编码器和 3 亿参数音频编码器。只做文本检索的话,只装主干就够了。许可证是 Apache 2.0,可以商用。
规格
上下文长度 8K token。按官方的换算,一次输入大约能塞进 5.5 分钟音频、29 张图片或 58 帧视频。
输出是 768 维向量,可以截成 512、256 或 128 维。这靠的是 Matryoshka 表示学习,截短后精度损失较小,官方说本地存储和索引最多能省到原来的六分之一左右(开发者博客另一处写的是最多 8 倍)。
端侧占用是这次的重点数字。量化后在 Pixel 11 Pro 上,纯文本版本运行时约占 191MB 内存,多模态全开约 567MB。在 MacBook 的 M5 Pro GPU 上,处理一张图片约 37.3 毫秒,每秒约 27 张。模型提供 INT4 和 INT8 两种量化版本。
跑分方面,代码检索基准 MTEB Code 得分 78.68,初代是 68.76,提高 9.92 分。图像嵌入基准 MIEB Lite 和音频嵌入基准 MAEB 上,Google 称它领先同量级模型,但公告里没有列出具体对手和分数。多语言文本检索和初代持平。
配套的几个演示
Google AI Edge Gallery 应用(安卓和 iOS 都有)新增两个演示:即时媒体搜索,用一句话在相册里找图;视频时刻查找,定位视频里某个画面出现的位置。Mac 上另有一个叫 Foresight 的会议助手,本地记笔记,还能跨文字和录音检索。
开发者可以从 Hugging Face、Kaggle 下载权重,LiteRT、MediaPipe、transformers.js、llama.cpp、Ollama 都已支持,浏览器里可以借 WebGPU 跑。安卓的 ML Kit 接口要在未来几周上线,届时会调用手机 NPU 加速。
对国内开发者
Apache 2.0 加上 Ollama、llama.cpp 支持,国内团队可以直接拉下来做私有化部署,相册检索、会议录音检索、企业内网知识库这类对数据外传敏感的场景用得上。Hugging Face 在国内直连不稳定,下载一般要走镜像。
国内同类开源模型并不少,此前微信团队开源的多模态嵌入模型在 MMEB-v2 榜上排过第一。差别在体量:EmbeddingGemma 2 从一开始就按手机内存来设计,567MB 这个数字是冲着端侧去的。中文效果上,Google 只说多语言能力与初代持平,没有单独给出中文检索分数,接入前最好拿自己的语料先测一轮。
参考来源:Google 官方博客、CocoLoop、Google Developers Blog;Google DeepMind 模型页核验参数构成、上下文长度与 MTEB Code 分数,开发者博客核验端侧内存与图片处理速度。