Googleは10月6日、オープンウェイトのマルチモーダル埋め込みモデル「EmbeddingGemma 2」を発表した。テキスト、コード、画像、動画のフレーム、音声を同じベクトル空間にマッピングでき、データを端末外に出さずにスマートフォンやノートPC上でローカル検索を行うことを目的としている。
モデルはGemma 4をベースにしており、フルバージョンは約7.4億パラメータで、3つの部分から構成される。2.7億パラメータのテキストバックボーンに加え、オプションの1.7億パラメータの画像エンコーダーと3億パラメータの音声エンコーダーがある。テキスト検索のみであればバックボーンだけで十分だ。ライセンスはApache 2.0で、商用利用も可能。
仕様
コンテキスト長は8Kトークン。Google公式の換算によると、1回の入力でおよそ5.5分の音声、29枚の画像、58フレームの動画を収められる。
出力は768次元のベクトルで、512、256、128次元に切り詰めることができる。これはMatryoshka表現学習によるもので、切り詰めによる精度の低下は比較的小さい。Google公式によれば、ローカルのストレージとインデックスは元の最大6分の1程度まで縮小できるという(開発者向けブログの別の箇所では最大8倍という数字も示されている)。
端末上での占有サイズが今回の目玉数値だ。量子化後のPixel 11 Proでは、テキスト専用バージョンの実行時メモリ使用量は約191MB、マルチモーダルをすべて有効にすると約567MBになる。MacBookのM5 Pro GPUでは、1枚の画像の処理に約37.3ミリ秒、1秒あたり約27枚を処理できる。モデルはINT4とINT8の2種類の量子化バージョンを提供する。
ベンチマークでは、コード検索の指標であるMTEB Codeが78.68点となり、初代の68.76点から9.92点上昇した。画像埋め込みのベンチマークMIEB Liteと音声埋め込みのベンチマークMAEBでは、Googleは同規模のモデルを上回るとしているが、発表では具体的な競合モデルや点数は示されていない。多言語テキスト検索の性能は初代と同水準。
関連するいくつかのデモ
Google AI Edge Galleryアプリ(Android・iOS両対応)に新たに2つのデモが追加された。1つは一言で写真を探せる「インスタントメディア検索」、もう1つは動画内の特定の場面がどこに出てくるかを特定する「動画モーメント検索」だ。Mac向けには「Foresight」という会議アシスタントもあり、ローカルでメモを取り、文字記録と録音の両方を横断して検索できる。
開発者はHugging FaceやKaggleからウェイトをダウンロードできる。LiteRT、MediaPipe、transformers.js、llama.cpp、Ollamaはすでに対応しており、ブラウザ上ではWebGPUを使って動かすこともできる。AndroidのML Kitインターフェースは今後数週間以内に提供される予定で、その際にはスマートフォンのNPUによる高速化が利用できるようになる。
中国の開発者にとって
Apache 2.0ライセンスに加えてOllamaやllama.cppがサポートしていることで、中国のチームはモデルをそのまま取得してプライベートに展開できる。写真検索、会議録音の検索、社内ナレッジベースなど、データの外部流出に敏感な場面で使い道がある。Hugging Faceへの中国国内からの直接アクセスは不安定なことが多く、ダウンロードは通常ミラー経由になる。
中国国内にも同種のオープンソースモデルは少なくない。以前WeChat(微信)チームが公開したマルチモーダル埋め込みモデルは、MMEB-v2のランキングで1位になったことがある。違いは規模にある。EmbeddingGemma 2は当初からスマートフォンのメモリを基準に設計されており、567MBという数字は端末上での利用を狙ったものだ。中国語の性能については、Googleは多言語性能が初代と同水準だとしか述べておらず、中国語検索単独のスコアは示していない。導入前には自前のコーパスで一度テストしておくのが望ましい。
参考資料:Google公式ブログ、CocoLoop、Google Developers Blog。パラメータ構成、コンテキスト長、MTEB CodeのスコアはGoogle DeepMindのモデルページで確認、端末上のメモリ使用量と画像処理速度は開発者向けブログで確認。