Google mã nguồn mở mô hình embedding đa phương thức 740 triệu tham số

Ngày 6/10, Google phát hành EmbeddingGemma 2, một mô hình embedding đa phương thức có trọng số mở. Mô hình có thể ánh xạ văn bản, mã nguồn, hình ảnh, khung hình video và âm thanh vào cùng một không gian vector, phục vụ việc tìm kiếm cục bộ trên điện thoại và laptop mà không cần dữ liệu rời khỏi thiết bị.

Mô hình được xây dựng trên nền Gemma 4, bản đầy đủ có khoảng 740 triệu tham số, ghép từ ba phần: khối văn bản chính 270 triệu tham số, cộng thêm bộ mã hóa hình ảnh tùy chọn 170 triệu tham số và bộ mã hóa âm thanh 300 triệu tham số. Nếu chỉ cần tìm kiếm văn bản thì chỉ cần cài khối chính là đủ. Giấy phép Apache 2.0, cho phép dùng trong mục đích thương mại.

Thông số kỹ thuật

Độ dài ngữ cảnh 8K token. Theo cách quy đổi chính thức, một lần nhập có thể chứa khoảng 5,5 phút âm thanh, 29 ảnh hoặc 58 khung hình video.

Đầu ra là vector 768 chiều, có thể cắt xuống còn 512, 256 hoặc 128 chiều nhờ kỹ thuật học biểu diễn Matryoshka, sau khi cắt độ chính xác giảm không nhiều. Google cho biết việc lưu trữ và đánh chỉ mục cục bộ có thể giảm tối đa khoảng 1/6 so với bản gốc (một bài khác trên blog nhà phát triển lại ghi là giảm tối đa 8 lần).

Mức chiếm dụng trên thiết bị là số liệu đáng chú ý nhất lần này. Sau khi lượng tử hóa, trên Pixel 11 Pro, bản chỉ xử lý văn bản chiếm khoảng 191MB bộ nhớ khi chạy, bản mở đầy đủ đa phương thức chiếm khoảng 567MB. Trên GPU M5 Pro của MacBook, xử lý một ảnh mất khoảng 37,3 mili giây, tương đương khoảng 27 ảnh mỗi giây. Mô hình có hai bản lượng tử hóa INT4 và INT8.

Về điểm số, trên bộ đánh giá tìm kiếm mã nguồn MTEB Code, mô hình đạt 78,68 điểm, so với 68,76 của bản đầu tiên, tăng 9,92 điểm. Trên bộ đánh giá embedding hình ảnh MIEB Lite và embedding âm thanh MAEB, Google nói mô hình dẫn đầu trong nhóm các mô hình cùng kích thước, nhưng thông báo không nêu cụ thể đối thủ và điểm số. Khả năng tìm kiếm văn bản đa ngôn ngữ ngang bằng bản đầu tiên.

Vài bản demo đi kèm

Ứng dụng Google AI Edge Gallery (có cả trên Android và iOS) bổ sung hai bản demo: tìm kiếm media ngay lập tức, cho phép dùng một câu để tìm ảnh trong album; tìm khoảnh khắc trong video, xác định vị trí một hình ảnh xuất hiện trong video. Trên Mac còn có một trợ lý họp tên Foresight, ghi chú cục bộ, có thể tìm kiếm xuyên suốt giữa văn bản và bản ghi âm.

Nhà phát triển có thể tải trọng số từ Hugging Face, Kaggle. LiteRT, MediaPipe, transformers.js, llama.cpp, Ollama đều đã hỗ trợ, có thể chạy trong trình duyệt bằng WebGPU. Giao diện ML Kit trên Android sẽ ra mắt trong vài tuần tới, khi đó sẽ dùng NPU của điện thoại để tăng tốc.

Đối với các nhóm phát triển ở Trung Quốc

Giấy phép Apache 2.0 cộng với hỗ trợ từ Ollama, llama.cpp giúp các nhóm ở Trung Quốc có thể tải về triển khai riêng, phù hợp cho các trường hợp nhạy cảm về việc dữ liệu rời khỏi thiết bị như tìm kiếm trong album ảnh, tìm kiếm bản ghi âm họp, hay cơ sở tri thức nội bộ doanh nghiệp. Hugging Face kết nối trực tiếp tại Trung Quốc không ổn định, tải xuống thường phải qua máy chủ trung gian.

Các mô hình embedding mã nguồn mở trong nước không phải là ít; mô hình embedding đa phương thức do nhóm WeChat phát hành trước đó từng đứng đầu bảng xếp hạng MMEB-v2. Khác biệt nằm ở kích thước: EmbeddingGemma 2 được thiết kế ngay từ đầu theo dung lượng bộ nhớ điện thoại, con số 567MB là nhắm vào mục tiêu chạy trên thiết bị. Về hiệu quả với tiếng Trung, Google chỉ nói khả năng đa ngôn ngữ ngang bằng bản đầu tiên, không đưa ra điểm số tìm kiếm tiếng Trung riêng, nên trước khi tích hợp tốt nhất nên tự thử với dữ liệu của mình.

Nguồn tham khảo: blog chính thức của Google, CocoLoop, Google Developers Blog; trang mô hình của Google DeepMind xác nhận cấu trúc tham số, độ dài ngữ cảnh và điểm MTEB Code, blog nhà phát triển xác nhận bộ nhớ trên thiết bị và tốc độ xử lý ảnh.