Ngày 16 tháng 3, Mistral đã phát hành Small 4, một cái tên nghe có vẻ bình thường nhưng ẩn chứa một ý tưởng sản phẩm khá thực tế – sử dụng kiến trúc MoE để gộp ba mô hình độc lập trước đây thành một, triển khai một lần là xử lý được mọi tình huống.
Một mô hình, ba mục đích
Trước đây, Mistral có ba mô hình, mỗi mô hình đảm nhận một nhiệm vụ riêng:
- Magistral: Chuyên xử lý các tác vụ phức tạp cần suy luận
- Pixtral: Phụ trách hiểu ảnh đa phương thức
- Devstral: Chuyên dùng để sinh mã và phát triển
Nếu phải dùng cả ba mô hình này, đồng nghĩa với ba bộ triển khai, ba logic điều phối và chi phí vận hành gấp ba lần. Small 4 đã hợp nhất chúng lại.
Một mô hình duy nhất, đồng thời hỗ trợ suy luận văn bản, hiểu ảnh, sinh mã, gọi hàm, xuất JSON, với cửa sổ ngữ cảnh 256K.
Logic cốt lõi của MoE: Lớn nhưng không đắt
Cấu hình tham số của Small 4 rất tiêu biểu:
| Chỉ số | Giá trị |
|---|---|
| Tổng số tham số | 119B |
| Số lượng Expert | 128 |
| Số Expert kích hoạt mỗi lần suy luận | 4 |
| Số tham số thực tế được kích hoạt | 6,5B |
| Cửa sổ ngữ cảnh | 256K |
119B nghe có vẻ đáng sợ, nhưng mỗi lần suy luận chỉ thực sự sử dụng 6,5B tham số – đây là giá trị cốt lõi của kiến trúc MoE: mô hình biết nhiều hơn, nhưng khi tính toán chỉ dùng một phần nhỏ. Chi phí suy luận gần tương đương một mô hình dense 6,5B, nhưng khả năng lại rộng hơn nhiều.
So với Small 3, độ trễ đầu cuối giảm 40%, và số lượng yêu cầu có thể xử lý mỗi giây gấp 3 lần.
Logic này đi cùng hướng với DeepSeek V3 và Qwen3: không dùng tổng tham số lớn hơn để gây ấn tượng, mà dựa vào kích hoạt thưa thớt để tìm sự cân bằng giữa hiệu quả và khả năng.
reasoning_effort: Bật/tắt khả năng suy luận theo nhu cầu
Đây là một điểm khá thực tế trong thiết kế sản phẩm lần này.
Trước đây, bạn phải chọn giữa mô hình phản hồi nhanh và mô hình suy luận chậm, và thường phải triển khai hai mô hình khác nhau để thực hiện. Small 4 thêm một tham số, cho phép bạn kiểm soát trực tiếp ở cấp độ yêu cầu API: lần này có cần dùng khả năng suy luận hay không, và dùng bao nhiêu.
Câu hỏi đơn giản thì trả lời nhanh, câu hỏi phức tạp thì để nó suy nghĩ lâu hơn – cùng một mô hình, cùng một API, không cần chuyển đổi. Thiết kế này giúp các nhóm kỹ thuật tiết kiệm được nhiều công sức.
Giấy phép mã nguồn mở và kênh sử dụng
Lần này Mistral tiếp tục phát hành theo giấy phép Apache 2.0, không hạn chế sử dụng thương mại, có thể tải trọng số trực tiếp để tự triển khai.
Các nơi hiện có thể sử dụng:
- Mistral API và AI Studio
- Hugging Face (tải trọng số đầy đủ)
- NVIDIA build.nvidia.com (dùng thử nguyên mẫu miễn phí)
- NVIDIA NIM container (triển khai sản xuất)
Apache 2.0 là giấy phép sạch nhất cho doanh nghiệp – không lo về giới hạn sử dụng, có thể sửa đổi và phân phối mà không vấn đề gì.
Nhìn trong bối cảnh xu hướng mô hình lớn mã nguồn mở
Hai năm gần đây, cục diện cạnh tranh của các mô hình lớn mã nguồn mở thay đổi rất nhanh. DeepSeek V3 dùng MoE kết hợp huấn luyện chi phí thấp đã làm suy yếu hào phòng thủ của mô hình đóng, Alibaba Qwen3 mở rộng thị trường với giấy phép Apache, và Meta Llama 4 cũng vừa phát hành phiên bản MoE vào tháng 4.
Small 4 của Mistral lần này đi theo con đường tương tự: tổng 119B, kích hoạt 6,5B, giấy phép Apache, gói gọn suy luận, đa phương thức và mã vào một đơn vị triển khai duy nhất. Hai năm trước, cấu hình này chỉ có ở các mô hình đóng hàng đầu, giờ đây có thể tải miễn phí.
Đối với các nhóm muốn tự xây dựng năng lực AI trong môi trường sản xuất, các lựa chọn mô hình mã nguồn mở đang chuyển từ "dùng tạm" sang "cân nhắc nghiêm túc". Small 4 gia nhập nhóm lựa chọn này, giá trị chính là giảm độ phức tạp triển khai – không cần duy trì ba mô hình cùng lúc, một là đủ.
Có phù hợp với tình huống của bạn hay không, vẫn cần chạy benchmark. Mistral tuyên bố chính thức rằng hỗ trợ tiếng Trung không tốt bằng tiếng Anh, điều này cần được các nhóm trong nước đánh giá riêng.
Nguồn tham khảo: CocoLoop, 119B Parameters, 6.5B Activated: Mistral Small 4 Collapses Three Open Models Into One (BaristaLabs Blog); Mistral AI Releases Mistral Small 4 (MarkTechPost)