Ngày 5 tháng 4 năm ngoái, Meta phát hành Llama 4, đánh dấu lần đầu tiên dòng Llama sử dụng kiến trúc MoE. Đồng thời ra mắt hai phiên bản:
Llama 4 Scout
- Tham số kích hoạt: 17B / Tổng tham số khoảng 109B
- Số lượng chuyên gia: 16
- Cửa sổ ngữ cảnh: 10 triệu token
Đúng vậy, 10 triệu token ngữ cảnh. Con số này ngay lập tức phá kỷ lục trong giới mô hình mã nguồn mở thời điểm đó.
Llama 4 Maverick
- Tham số kích hoạt: 17B / Tổng tham số khoảng 400B
- Số lượng chuyên gia: 128
- Cửa sổ ngữ cảnh: 1 triệu token
128 chuyên gia, các lớp MoE và dense xen kẽ nhau — chuyên gia chỉ tham gia tính toán ở một nửa số lớp.
Đa phương thức gốc
Cả hai mô hình đều đạt được đa phương thức gốc thông qua early fusion — văn bản và hình ảnh không được ghép nối bằng adapter bên ngoài mà được xử lý hợp nhất ngay bên trong mô hình. Dữ liệu huấn luyện vượt quá 30 nghìn tỷ token, bao gồm hơn 200 ngôn ngữ.
Hiệu năng
Maverick vượt qua GPT-4o và Gemini 2.0 ở các khía cạnh lập trình, suy luận, đa ngôn ngữ, ngữ cảnh dài và hiểu hình ảnh, đồng thời cũng có thể cạnh tranh với DeepSeek V3.1 có kích thước lớn hơn nhiều.
Scout định vị theo hướng phổ thông — hỗ trợ lượng tử hóa 4-bit và 8-bit, có thể chạy trên một GPU duy nhất.
Còn có Llama 4 Behemoth (288B tham số kích hoạt), được công bố nhưng chưa mã nguồn mở, lúc đó vẫn đang trong quá trình huấn luyện.
Một chi tiết: Meta tự gọi đây là "open-weight" chứ không phải "open-source". Trọng số mô hình được công khai và có thể tinh chỉnh, nhưng mã huấn luyện đầy đủ và bộ dữ liệu không được phát hành.
Nguồn tham khảo: CocoLoop, blog chính thức của Meta AI