Mistral ra mắt bản xem trước Large 4, mô hình 1.000 tỷ tham số

Công ty AI Pháp Mistral ngày 6 tháng 10 phát hành bản xem trước nghiên cứu của Mistral Large 4. Hãng đặt cho nó biệt danh "le Chonk", đại khái nghĩa là "khối to". Đây là mô hình hỗn hợp chuyên gia (MoE) đa phương thức gốc, tổng cộng 1.000 tỷ tham số, khoảng 49 tỷ tham số được kích hoạt cho mỗi token, cửa sổ ngữ cảnh 512K, hỗ trợ đầu vào văn bản và hình ảnh, đầu ra văn bản.

Bản xem trước hiện mở qua Mistral API, ưu tiên cho nhà phát triển, các trưởng bộ phận an ninh mạng và cơ quan chính phủ; công ty dự kiến mở rộng phạm vi vào cuối tháng này và sẽ phát hành trọng số mở vào cuối tháng 10.

Huấn luyện và định hướng

Theo blog chính thức của Mistral, Large 4 được huấn luyện từ đầu, sử dụng trung tâm dữ liệu riêng của công ty tại châu Âu, khoảng 3.800 GPU Nvidia Grace Blackwell; CNBC đưa tin chu kỳ huấn luyện khoảng hai tháng. Mistral xác định các thế mạnh của mô hình là an ninh mạng, lập trình, sản xuất, tài chính và các nhiệm vụ đa phương thức.

Công ty tuyên bố công khai rằng Large 4 là "mô hình trọng số mở mạnh nhất ngoài Trung Quốc, và dẫn trước với khoảng cách lớn". CNBC cũng đưa tin Mistral thừa nhận mô hình vẫn còn thua các mô hình đóng tiên tiến nhất ở một số lĩnh vực như lập trình.

API cung cấp hai chế độ suy luận: none và high. Nhà phát triển Simon Willison khi thử nghiệm nhận thấy chế độ high lại cho ít token đầu ra hơn, trung bình 2.717 token, còn chế độ none là 3.275 token, và kết quả ở chế độ high cũng tốt hơn. Đánh giá tổng thể của ông là Large 4 tụt sau các mô hình hàng đầu khoảng nửa năm.

Bên thứ ba chấm điểm thế nào

Tổ chức đánh giá độc lập Artificial Analysis cho chỉ số thông minh 38 điểm. Đặt cạnh nhau để so sánh:

Mô hìnhChỉ số thông minh
DeepSeek V4.1 Flash39
Mistral Large 438
GPT-6 Luna (max)38
Mistral Large 39

Khoảng cách giữa hai thế hệ là 29 điểm, Large 3 thế hệ trước với 9 điểm rõ ràng tụt lại phía sau trên bảng này. Artificial Analysis vì vậy gọi đây là "mô hình thông minh nhất ngoài Mỹ và Trung Quốc". Chỉ số an ninh mạng của tổ chức này cho Large 4 50 điểm, còn bài kiểm tra suy luận văn bản (GDP.pdf) chỉ đạt tỷ lệ vượt 19%, đây là điểm rõ ràng còn yếu.

Tính một bài toán chi phí

Giá API bản xem trước là 1,36 USD cho mỗi triệu token đầu vào, 4,18 USD cho đầu ra, token đầu vào trúng cache là 0,14 USD mỗi triệu; giảm 50% trong hai tuần đầu ra mắt. Artificial Analysis quy đổi theo bộ nhiệm vụ riêng, chi phí mỗi nhiệm vụ là 1,13 USD, thời gian giảm giá là 0,57 USD.

Thử tính một tình huống thường gặp: đưa vào 1 triệu token mã nguồn hoặc tài liệu, cho ra 200.000 token kết quả, giá gốc khoảng 2,2 USD, thời gian giảm giá khoảng 1,1 USD. Đơn giá đầu ra gấp khoảng 3 lần đầu vào, các nhiệm vụ agent có đầu ra dài sẽ đắt hơn.

Tỷ lệ kích hoạt cũng có thể tính được. 49 tỷ tham số kích hoạt trên tổng 1.000 tỷ, khoảng 4,9%, gần với Reflection Beam ra mắt một ngày trước đó (23 tỷ kích hoạt trên tổng 501 tỷ, khoảng 4,6%). Chi phí suy luận chủ yếu đi theo số tham số kích hoạt, nên cả hai công ty đều nhắc đến "hiệu quả".

Ngưỡng triển khai lại là chuyện khác. Tính theo độ chính xác 8-bit, chỉ riêng lưu trữ trọng số 1.000 tỷ tham số đã cần khoảng 1TB VRAM, lượng tử hóa 4-bit thì khoảng 500GB; sau khi có trọng số mở, phần lớn các nhóm phát triển nhiều khả năng vẫn phải dựa vào nhà cung cấp cloud hoặc chờ các phiên bản chưng cất (distill) từ cộng đồng.

Lá bài châu Âu

Mistral vừa hoàn tất vòng gọi vốn 3 tỷ euro vào tháng 9, do Samsung dẫn đầu. Large 4 là mô hình chủ lực đầu tiên sau khi số tiền này về tay, hai điểm tự xây hạ tầng tính toán và huấn luyện trên đất châu Âu được công ty nhắc lại nhiều lần, xét theo trọng tâm truyền thông, mục tiêu nhắm đến là mua sắm từ chính phủ châu Âu và các ngành bị quản lý chặt.

Điều khoản giấy phép của trọng số mở và ngày phát hành cụ thể, Mistral hiện vẫn chưa công bố. Mọi điểm số hiện tại cũng chỉ mới có dữ liệu từ chính hãng và một số ít tổ chức đánh giá, cộng đồng sau khi có trọng số có thể tái lập được bao nhiêu, phải đến cuối tháng mới rõ.

Nguồn tham khảo: blog chính thức của Mistral, Artificial Analysis, CocoLoop, CNBC, blog của Simon Willison; chỉ số thông minh và chi phí mỗi nhiệm vụ theo dữ liệu công bố của Artificial Analysis, giá API theo bảng giá bản xem trước của Mistral, nhu cầu VRAM là tính toán ước lượng theo số tham số.