Google Open-Source-kan Model Embedding Multimodal 740 Juta Parameter

Pada 6 Oktober, Google merilis EmbeddingGemma 2, model embedding multimodal berbobot terbuka (open-weight). Model ini memetakan teks, kode, gambar, frame video, dan audio ke ruang vektor yang sama, dengan tujuan untuk pencarian lokal di ponsel dan laptop tanpa data harus meninggalkan perangkat.

Model ini dibangun di atas Gemma 4. Versi lengkapnya memiliki sekitar 740 juta parameter, yang terdiri dari tiga bagian: tulang punggung teks (text backbone) dengan 270 juta parameter, ditambah encoder visual opsional dengan 170 juta parameter dan encoder audio dengan 300 juta parameter. Untuk pencarian teks saja, tulang punggung ini sudah cukup. Lisensinya Apache 2.0 dan boleh dipakai untuk komersial.

Spesifikasi

Panjang konteksnya 8K token. Menurut konversi resmi Google, satu input bisa menampung sekitar 5,5 menit audio, 29 gambar, atau 58 frame video.

Outputnya berupa vektor 768 dimensi, yang bisa dipotong menjadi 512, 256, atau 128 dimensi. Ini mengandalkan Matryoshka representation learning, di mana pemotongan dimensi hanya menyebabkan sedikit penurunan akurasi; Google menyebut penyimpanan dan pengindeksan lokal bisa mengecil hingga sekitar seperenam dari ukuran aslinya (meski bagian lain dari blog developer menyebut angka hingga 8 kali lipat).

Jejak memori di perangkat (on-device) jadi angka utama kali ini. Setelah dikuantisasi di Pixel 11 Pro, versi teks saja memakai sekitar 191MB memori saat berjalan, naik menjadi sekitar 567MB saat seluruh fitur multimodal diaktifkan. Di GPU M5 Pro pada MacBook, memproses satu gambar memerlukan sekitar 37,3 milidetik, atau sekitar 27 gambar per detik. Model ini tersedia dalam versi kuantisasi INT4 dan INT8.

Dari sisi skor benchmark, benchmark pencarian kode MTEB Code mencatat skor 78,68, naik 9,92 poin dari generasi pertama yang mencatat 68,76. Pada benchmark embedding gambar MIEB Lite dan benchmark embedding audio MAEB, Google menyebut model ini memimpin dibanding model-model sekelasnya, meski pengumuman tersebut tidak mencantumkan pesaing atau skor spesifik. Pencarian teks multibahasa setara dengan generasi pertama.

Beberapa demo pendukung

Aplikasi Google AI Edge Gallery (tersedia di Android dan iOS) menambahkan dua demo baru: pencarian media instan, yang mencari foto di galeri hanya dengan satu kalimat, dan pencarian momen video, yang menemukan lokasi munculnya suatu momen dalam video. Di Mac, ada juga asisten rapat bernama Foresight yang mencatat secara lokal dan bisa mencari lintas teks maupun rekaman audio.

Developer bisa mengunduh bobot model dari Hugging Face dan Kaggle. LiteRT, MediaPipe, transformers.js, llama.cpp, dan Ollama sudah mendukungnya, dan model ini juga bisa berjalan di browser lewat WebGPU. Antarmuka ML Kit untuk Android akan hadir dalam beberapa minggu ke depan, dan saat itu akan memanfaatkan NPU ponsel untuk akselerasi.

Bagi developer di China

Dengan lisensi Apache 2.0 ditambah dukungan Ollama dan llama.cpp, tim di China bisa langsung menarik model ini untuk deployment privat — berguna untuk skenario yang sensitif terhadap kebocoran data seperti pencarian galeri foto, pencarian rekaman rapat, dan basis pengetahuan internal perusahaan. Akses langsung ke Hugging Face dari dalam China cenderung tidak stabil, sehingga unduhan biasanya harus lewat mirror.

China sendiri sudah punya cukup banyak model open source sejenis — model embedding multimodal yang sebelumnya dirilis open source oleh tim WeChat pernah menduduki posisi pertama di papan peringkat MMEB-v2. Perbedaannya ada pada skala: EmbeddingGemma 2 sejak awal dirancang mengikuti batas memori ponsel, dan angka 567MB itu memang diarahkan untuk penggunaan on-device. Untuk performa bahasa Mandarin, Google hanya menyebut kemampuan multibahasanya setara dengan generasi pertama, tanpa memberikan skor pencarian bahasa Mandarin secara khusus — sebaiknya diuji dulu dengan korpus sendiri sebelum diadopsi.

Sumber: blog resmi Google, CocoLoop, Google Developers Blog; susunan parameter, panjang konteks, dan skor MTEB Code diverifikasi dari halaman model Google DeepMind, sementara penggunaan memori di perangkat dan kecepatan pemrosesan gambar diverifikasi dari blog developer.