WeChat mã nguồn mở mô hình embedding đa phương thức, dẫn đầu MMEB-v2

Đội ngũ Thị giác WeChat của Tencent vừa mã nguồn mở WeMM-Embedding, một bộ mô hình embedding đa phương thức đa dụng. Mã nguồn và trọng số được đăng đồng thời trên GitHub và Hugging Face, báo cáo kỹ thuật mang số hiệu arXiv 2608.24053, phần mã nguồn sử dụng giấy phép Apache 2.0.

Công việc của một mô hình embedding là nén nội dung thành một chuỗi vector, để những thứ tương tự nằm gần nhau trong không gian vector — truy xuất, khử trùng lặp, gợi ý đều dựa vào đó mà vận hành. Phạm vi bao phủ của WeMM-Embedding rộng hơn phần lớn mô hình cùng loại: văn bản, hình ảnh, video, tài liệu hình ảnh, và cả các đầu vào xen kẽ tùy ý giữa những dạng này, tất cả đều dùng chung một cách biểu diễn. Âm thanh tạm thời chưa được hỗ trợ.

Ba cỡ mô hình và thành tích trên bảng xếp hạng

Dòng mô hình này có ba cỡ: 2B, 4B và 9B. Trên 78 bộ dữ liệu của MMEB-v2, phiên bản 2B đạt tổng điểm 77,9 (hình ảnh 79,6; video 70,8; tài liệu hình ảnh 80,7), bản 4B đạt 79,2, còn bản 9B đạt 80,6 — đứng đầu bảng xếp hạng chính thức, vượt qua tất cả các mô hình mã nguồn mở lẫn mã nguồn đóng đã được liệt kê.

So sánh ngang hàng mới thấy rõ vị trí thực sự. Phiên bản 2B cao hơn Qwen3-VL-Embedding-2B 4,7 điểm, cao hơn DME-2B 3,1 điểm, đồng thời nhỉnh hơn một chút so với Qwen3-VL-Embedding-8B có số tham số gấp bốn lần. Trong loại bài toán này, trọng số của công thức huấn luyện và chất lượng dữ liệu đã lấn át quy mô tham số thuần túy.

Quá trình huấn luyện chia làm hai giai đoạn: trước tiên căn chỉnh đa phương thức trên quy mô lớn, sau đó tinh chỉnh bằng dữ liệu chọn lọc. Giai đoạn tinh chỉnh bổ sung giám sát mức độ liên quan chi tiết và chuyển giao tri thức xuyên quy mô — những gì mô hình lớn học được sẽ được truyền sang mô hình nhỏ, đây cũng là một trong những lý do giúp bản 2B vượt cấp.

Có thể cắt giảm số chiều

Cả ba cỡ mô hình đều hỗ trợ biểu diễn kiểu Matryoshka, số chiều đầu ra có thể chọn từ 64 cho tới 2048 hoặc 4096. Con số chính thức được đưa ra: khi lấy 256 chiều trên MMEB-v2, các tác vụ hình ảnh và video vẫn giữ được 98,7% hiệu quả so với dùng đầy đủ số chiều.

Điều này có sức nặng với phía kỹ thuật còn hơn cả thứ hạng. Chi phí lưu trữ và truy xuất của cơ sở dữ liệu vector về cơ bản tỷ lệ thuận với số chiều: cắt từ 2048 xuống 256 chiều, dung lượng chỉ mục giảm còn một phần tám, phép tính khoảng cách ở giai đoạn truy hồi cũng giảm theo. Trước đây muốn làm việc này phải huấn luyện riêng một mô hình nhỏ hoặc gắn thêm một lớp giảm chiều; giờ chỉ cần lấy vài đoạn đầu của cùng một bộ trọng số là đủ. Về mặt triển khai, embedding được lấy từ trạng thái ẩn tại vị trí token chuyên dụng <embedding> ở lớp cuối cùng, sau đó chuẩn hóa L2.

Đã chạy trên lưu lượng thực tế

Báo cáo kỹ thuật nhắc tới một bộ đánh giá nội bộ gồm 26 tác vụ, cùng 14 nhóm thử nghiệm A/B trực tuyến trên các nghiệp vụ khác nhau của WeChat, tất cả đều cho kết quả cải thiện nhất quán. Những con số này bên ngoài không thể kiểm chứng lại, nhưng chúng cho thấy mô hình không chỉ dừng ở việc chạy đua thứ hạng — chức năng tìm kiếm Sou Yisou, Kênh video (Channels) và tìm kiếm nội dung Tài khoản chính thức (Official Accounts) của WeChat, tự bản thân quy mô sử dụng đã là một bài kiểm tra áp lực.

Những giới hạn cũng được nêu rõ: không hỗ trợ đầu vào âm thanh, trong mã đánh giá video được lấy mẫu theo 64 khung hình. Muốn xử lý video dài hoặc các tình huống truy xuất kết hợp âm thanh - hình ảnh, người dùng vẫn phải tự bổ sung thêm một lớp xử lý.

Với các đội đang làm RAG đa phương thức trong nước, tính khả dụng của cỡ 2B có sức nặng hơn cả việc bản 9B đứng đầu bảng xếp hạng. Ước tính sơ bộ, mô hình 2B kết hợp đầu ra 256 chiều có thể chạy chỉ mục hình ảnh - văn bản ở quy mô hàng chục triệu chỉ trên một card đồ họa, cấu trúc chi phí hoàn toàn khác so với việc gọi API mã nguồn đóng trước đây. Giấy phép mã nguồn Apache 2.0 cũng kéo ngưỡng sử dụng thương mại xuống rất thấp.

Nguồn tham khảo: Kho mã nguồn mở Tencent/WeMM-Embedding, báo cáo kỹ thuật arXiv 2608.24053, trang mô hình Hugging Face, CocoLoop; điểm số các cỡ mô hình trên MMEB-v2, khoảng số chiều Matryoshka và số nhóm thử nghiệm A/B trực tuyến lấy theo kho mã nguồn chính thức và báo cáo kỹ thuật.