구글, 7.4억 파라미터 임베딩 AI 오픈소스 공개

구글은 10월 6일 오픈 웨이트 멀티모달 임베딩 모델 EmbeddingGemma 2를 공개했다. 텍스트, 코드, 이미지, 동영상 프레임, 음성을 하나의 벡터 공간에 매핑할 수 있으며, 데이터를 기기 밖으로 보내지 않고 휴대폰과 노트북에서 로컬 검색을 하는 데 쓰인다.

모델은 Gemma 4를 기반으로 하며, 전체 버전은 약 7.4억 파라미터로 세 부분으로 구성된다. 2.7억 파라미터의 텍스트 백본에 선택적으로 쓸 수 있는 1.7억 파라미터 비전 인코더와 3억 파라미터 오디오 인코더가 더해진다. 텍스트 검색만 한다면 백본만 설치해도 충분하다. 라이선스는 Apache 2.0으로 상업적 이용도 가능하다.

사양

컨텍스트 길이는 8K 토큰이다. 구글의 자체 환산에 따르면 한 번의 입력에 약 5.5분 분량의 음성, 29장의 이미지, 58프레임의 동영상을 담을 수 있다.

출력은 768차원 벡터이며 512, 256, 128차원으로 줄일 수 있다. 이는 마트료시카(Matryoshka) 표현 학습을 활용한 것으로, 차원을 줄여도 정확도 손실은 비교적 적다. 구글은 로컬 저장과 인덱싱 용량을 최대 원래의 6분의 1 수준까지 줄일 수 있다고 밝혔다(개발자 블로그의 다른 부분에서는 최대 8배라는 수치도 제시됐다).

이번 발표의 핵심 수치는 기기 내 점유 용량이다. 양자화 후 Pixel 11 Pro에서 텍스트 전용 버전은 실행 시 메모리를 약 191MB 사용하며, 멀티모달 기능을 모두 켜면 약 567MB까지 늘어난다. MacBook의 M5 Pro GPU에서는 이미지 한 장을 처리하는 데 약 37.3밀리초, 초당 약 27장을 처리할 수 있다. 모델은 INT4와 INT8 두 가지 양자화 버전으로 제공된다.

벤치마크 기준으로 코드 검색 벤치마크인 MTEB Code 점수는 78.68점으로, 1세대의 68.76점보다 9.92점 올랐다. 이미지 임베딩 벤치마크 MIEB Lite와 오디오 임베딩 벤치마크 MAEB에서는 구글이 비슷한 규모의 모델보다 앞선다고 밝혔지만, 발표에는 구체적인 경쟁 모델이나 점수는 공개되지 않았다. 다국어 텍스트 검색 성능은 1세대와 비슷한 수준이다.

함께 나온 몇 가지 데모

Google AI Edge Gallery 앱(안드로이드·iOS 모두 지원)에 새로운 데모 두 가지가 추가됐다. 하나는 한 문장으로 사진첩에서 이미지를 찾는 '즉석 미디어 검색'이고, 다른 하나는 동영상 속 특정 장면이 나오는 위치를 찾아주는 '동영상 순간 검색'이다. 맥에서는 'Foresight'라는 회의 비서 기능도 있는데, 로컬에서 메모를 하고 텍스트와 녹음 기록을 함께 검색할 수 있다.

개발자는 Hugging Face와 Kaggle에서 가중치를 내려받을 수 있다. LiteRT, MediaPipe, transformers.js, llama.cpp, Ollama가 이미 이를 지원하며, 브라우저에서는 WebGPU로 실행할 수도 있다. 안드로이드의 ML Kit 인터페이스는 앞으로 몇 주 안에 제공될 예정이며, 이때부터는 휴대폰의 NPU로 가속할 수 있게 된다.

중국 개발자를 위한 참고사항

Apache 2.0 라이선스에 Ollama, llama.cpp 지원이 더해져 중국 내 팀들은 모델을 그대로 가져와 사설(프라이빗) 환경에 배포할 수 있다. 사진첩 검색, 회의 녹음 검색, 사내 지식베이스처럼 데이터 외부 유출에 민감한 분야에 활용할 수 있다. 중국 내에서 Hugging Face에 직접 접속하는 것은 불안정한 경우가 많아 다운로드는 보통 미러 사이트를 거친다.

중국에도 비슷한 오픈소스 모델이 적지 않다. 이전에 위챗(WeChat) 팀이 오픈소스로 공개한 멀티모달 임베딩 모델은 MMEB-v2 순위에서 1위를 차지한 적이 있다. 차이는 규모에 있다. EmbeddingGemma 2는 처음부터 휴대폰 메모리를 기준으로 설계됐고, 567MB라는 수치는 기기 내 사용을 노린 것이다. 중국어 성능에 대해서는 구글이 다국어 능력이 1세대와 비슷한 수준이라고만 밝혔을 뿐, 중국어 검색만 따로 떼어낸 점수는 제시하지 않았다. 도입 전에 자체 데이터로 한 번 테스트해 보는 것이 좋다.

참고 출처: 구글 공식 블로그, CocoLoop, Google Developers Blog. 파라미터 구성, 컨텍스트 길이, MTEB Code 점수는 Google DeepMind 모델 페이지로 확인했고, 기기 내 메모리 사용량과 이미지 처리 속도는 개발자 블로그로 확인했다.