Ngày 2 tháng 4, Google DeepMind đã phát hành Gemma 4.
Đây không phải là phiên bản Gemma đầu tiên, nhưng có hai điểm khác biệt so với trước: thứ nhất, chuyển sang giấy phép Apache 2.0; thứ hai, phiên bản 31B đã đạt vị trí thứ ba trên bảng xếp hạng mã nguồn mở Arena AI.
Bốn mô hình, chọn như thế nào?
| Phiên bản | Loại | Tham số kích hoạt | Ngữ cảnh | Khả năng đặc biệt |
|---|---|---|---|---|
| E2B | Dense (tối ưu thiết bị) | 2B | 128K | Đầu vào âm thanh |
| E4B | Dense (tối ưu thiết bị) | 4B | 128K | Đầu vào âm thanh |
| 26B A4B | MoE | ~4B | 256K | — |
| 31B | Dense (flagship) | 31B | 256K | — |
E2B và E4B được thiết kế cho điện thoại và thiết bị biên, hỗ trợ đầu vào âm thanh gốc (nhận dạng giọng nói), đa phương thức bao gồm văn bản + hình ảnh + âm thanh. Thiết kế MoE của 26B tương tự DeepSeek: tổng tham số 26B, nhưng chỉ kích hoạt khoảng 4B khi suy luận, mang lại hiệu quả chi phí cao.
31B là phiên bản flagship, đứng thứ ba trong số các mô hình mã nguồn mở trên bảng xếp hạng văn bản Arena AI, còn 26B MoE đứng thứ sáu. Cả hai phiên bản lớn đều có hiệu suất vượt trội so với các đối thủ có ít tham số hơn 20 lần.
Ý nghĩa của Apache 2.0
Dòng Gemma trước đây sử dụng giấy phép tùy chỉnh, có các hạn chế sử dụng và yêu cầu đàm phán riêng với Google cho các tình huống thương mại. Sau khi chuyển sang Apache 2.0:
- Có thể sử dụng cho mục đích thương mại mà không cần xin phép
- Có thể sửa đổi mã và phân phối lại
- Không cần thêm bất kỳ điều khoản nào
Điều này cùng hướng với chiến lược mã nguồn mở Apache 2.0 của Qwen 3. Cuộc chiến giấy phép của các mô hình lớn mã nguồn mở hiện nay về cơ bản lấy Apache 2.0 làm chuẩn, ai còn sử dụng giấy phép hạn chế sẽ chịu thiệt.
Khả năng trên thiết bị thực tế đến đâu?
E2B và E4B được thiết kế cho điện thoại và Raspberry Pi. Theo Google, E4B nhanh hơn 4 lần và tiết kiệm 60% điện năng so với phiên bản trước. E2B có hiệu suất nhanh hơn 3 lần và độ trễ thấp hơn.
Xét đến bộ nhớ và sức mạnh tính toán của các điện thoại flagship hiện tại, E4B có thể chạy mượt mà. Google đã nói rõ rằng Gemma 4 sẽ là mô hình nền tảng cho Gemini Nano 4 trên các thiết bị Android vào cuối năm nay. Nói cách khác, đây không chỉ dành cho nhà phát triển mà cuối cùng sẽ đến tay người dùng phổ thông.
So với Meta Llama 4 thì thế nào?
Cùng thời điểm, Meta cũng đang thúc đẩy Llama 4. Cả hai đều cạnh tranh trong mảng mã nguồn mở, đều sử dụng MoE hoặc kiến trúc hiệu quả trên thiết bị, đều hỗ trợ đa phương thức và đều dùng giấy phép Apache 2.0.
Điểm khác biệt của Gemma 4 nằm ở khả năng trên thiết bị: hỗ trợ đầu vào âm thanh của dòng E và thiết kế siêu tiết kiệm năng lượng, đây là hướng mà Llama 4 hiện chưa tập trung phát triển. Nếu bạn là nhà phát triển làm việc với thiết bị di động hoặc IoT, dòng E của Gemma 4 đáng để cân nhắc kỹ lưỡng.
Hỗ trợ hơn 140 ngôn ngữ cũng rất có ý nghĩa đối với các tình huống không phải tiếng Anh. Hiệu suất tiếng Trung cụ thể ra sao, hãy chờ cộng đồng chạy thử nghiệm.
Nguồn tham khảo: CocoLoop, Gemma 4: Byte for byte, the most capable open models (Google DeepMind Blog); Google Releases Gemma 4 in Four Model Sizes Under Apache 2.0 License (gHacks Tech News); Announcing Gemma 4 in the AICore Developer Preview (Android Developers Blog)