위챗 멀티모달 임베딩 모델, MMEB-v2 1위

텐센트 위챗 비전팀이 범용 멀티모달 임베딩 모델군 'WeMM-Embedding'을 오픈소스로 공개했다. 코드와 가중치는 깃허브(GitHub)와 허깅페이스(Hugging Face)에 동시에 올라왔으며, 기술 보고서는 arXiv 2608.24053으로 등록됐고 코드는 Apache 2.0 라이선스를 적용했다.

임베딩 모델은 콘텐츠를 하나의 벡터로 압축해, 비슷한 것끼리 벡터 공간에서 가깝게 배치하는 역할을 한다. 검색, 중복 제거, 추천 기능이 모두 이 위에서 돌아간다. WeMM-Embedding이 다루는 범위는 같은 계열 모델보다 넓다. 텍스트, 이미지, 동영상, 시각 문서는 물론 이들을 임의로 섞은 입력까지 모두 같은 표현 체계로 처리한다. 다만 오디오는 아직 지원하지 않는다.

3가지 크기로 리더보드 1위

시리즈는 2B, 4B, 9B 세 가지 크기로 나온다. MMEB-v2의 78개 데이터셋을 기준으로 2B 모델은 종합 77.9점(이미지 79.6, 동영상 70.8, 시각 문서 80.7), 4B 모델은 79.2점, 9B 모델은 80.6점을 받아 공식 리더보드에서 1위에 올랐다. 목록에 오른 모든 오픈소스·클로즈드소스 모델을 앞선 결과다.

다른 모델과 나란히 놓고 보면 위치가 더 분명해진다. 2B 버전은 Qwen3-VL-Embedding-2B보다 4.7점, DME-2B보다 3.1점 높았고, 파라미터 수가 4배인 Qwen3-VL-Embedding-8B도 근소하게 앞섰다. 이런 유형의 작업에서는 학습 방식과 데이터 품질의 비중이 이미 단순한 파라미터 규모를 넘어섰다.

학습은 두 단계로 진행된다. 먼저 대규모 멀티모달 정렬(alignment)을 거친 뒤, 엄선된 데이터로 정밀 조정을 한다. 정밀 조정 단계에서는 세밀한 관련성 지도학습과 크로스 스케일 지식 전이를 추가했다. 큰 모델이 학습한 내용을 작은 모델로 옮기는 이 방식이 2B 모델이 상위 모델을 뛰어넘은 요인 중 하나다.

차원은 줄일 수 있다

세 가지 크기 모두 마트료시카(Matryoshka) 표현 학습을 지원해, 출력 차원을 64부터 2048 또는 4096까지 자유롭게 선택할 수 있다. 공식 수치에 따르면 MMEB-v2 기준으로 256차원까지 줄여도 이미지·동영상 작업에서 전체 차원 대비 98.7%의 성능을 유지한다.

이 부분은 리더보드 순위보다 엔지니어링 측면에서 의미가 크다. 벡터 데이터베이스의 저장·검색 비용은 차원 수에 거의 비례하므로, 2048차원을 256차원으로 줄이면 인덱스 크기가 8분의 1로 줄고 검색 시 거리 계산량도 그만큼 감소한다. 예전에는 이를 위해 별도의 소형 모델을 학습하거나 차원 축소 레이어를 따로 붙여야 했지만, 이제는 같은 가중치에서 앞부분만 잘라 쓰면 된다. 구현 측면에서 임베딩은 마지막 층의 전용 토큰 <embedding> 위치의 은닉 상태에서 추출한 뒤 L2 정규화를 거친다.

이미 실제 트래픽에서 가동 중

기술 보고서에는 사내 26개 과제로 구성된 평가 세트와 위챗 각 사업부에서 진행한 14개 그룹의 온라인 A/B 테스트가 언급됐으며, 모두 일관된 성능 향상을 보였다고 한다. 이 수치는 외부에서 검증할 수 없지만, 모델이 리더보드 점수 경쟁에만 머물지 않았다는 것을 보여준다. 위챗의 검색(써우이써우), 채널(스핀하오), 공식 계정 콘텐츠 검색은 그 자체로 규모가 큰 실전 스트레스 테스트이기 때문이다.

한계도 명확히 밝혔다. 오디오 입력은 지원하지 않고, 평가 코드에서는 동영상을 64프레임으로 샘플링한다. 긴 동영상이나 오디오·영상 결합 검색을 다루려면 별도의 레이어를 추가해야 한다.

중국에서 멀티모달 RAG를 다루는 팀 입장에서는 9B 모델의 1위 등극보다 2B 등급의 실용성이 더 중요하다. 대략 계산하면 2B 모델에 256차원 출력을 조합할 경우 GPU 한 장으로 수천만 건 규모의 이미지·텍스트 인덱스를 운용할 수 있다. 클로즈드소스 API에 의존하던 기존 방식과는 완전히 다른 비용 구조다. 코드에 적용된 Apache 2.0 라이선스도 상용화 문턱을 크게 낮춘다.

참고 출처: Tencent/WeMM-Embedding 오픈소스 저장소, arXiv 기술 보고서 2608.24053, 허깅페이스 모델 페이지, CocoLoop; MMEB-v2 등급별 점수, 마트료시카 차원 범위, 온라인 A/B 실험 그룹 수는 공식 저장소와 기술 보고서 기준이다.