Qwen3.8-Max dẫn đầu bảng lập trình, giá chỉ bằng 1/4 hạng nhì

Đội ngũ Qwen của Alibaba đã cập nhật mô hình chủ lực Qwen3.8-Max lên phiên bản 0902, bổ sung một vòng huấn luyện sau (post-training) tập trung vào lập trình và các tác vụ văn phòng chuyên nghiệp. Trên bảng xếp hạng lập trình frontend tổng thể của Code Arena, phiên bản này đạt 1691 điểm, đứng đầu bảng, cao hơn phiên bản trước 22 điểm.

Một con số khác mà Alibaba công bố cùng lúc còn cho thấy rõ hơn vị trí họ nhắm tới: giá trung bình tổng hợp của phiên bản mới là khoảng 5 USD cho mỗi triệu token, trong khi vị trí thứ hai và thứ ba ngay sau đó trên bảng xếp hạng lần lượt có giá 20 USD và 12 USD.

22 điểm và 15 USD

Khoảng cách ở top bảng xếp hạng vốn đã rất nhỏ. 1691 điểm chỉ cách phiên bản trước 22 điểm, mức chênh lệch này trong đánh giá mù của con người thường chỉ mất một, hai tuần là bị đối thủ khác bắt kịp. Điều thực sự tạo khoảng cách nằm ở cột bên phải: cùng một tác vụ lập trình frontend, nếu đổi sang mô hình xếp thứ hai trên bảng, hóa đơn sẽ tăng gấp bốn lần.

Theo các báo cáo công khai, giá API của phiên bản mới là 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra. Nếu lấy hai con số này suy ngược từ mức giá trung bình tổng hợp chính thức là 5 USD (tính gần đúng), token đầu ra phải chiếm khoảng ba phần tư tổng lượng sử dụng thì mới ra được con số 5. Tỷ lệ này không có gì lạ đối với các tác vụ lập trình frontend: ngữ cảnh đầu vào (prompt) thường chỉ vài trăm dòng, trong khi mô hình trả về là toàn bộ mã nguồn component — phần đầu ra vốn dĩ đã chiếm phần lớn. Mức giá trung bình 5 USD này được tính theo cơ cấu sử dụng thực tế của việc 'viết code'; nếu chuyển sang các tác vụ như tóm tắt văn bản dài — đầu vào nặng, đầu ra nhẹ — thì đơn giá thực tế còn thấp hơn nữa.

Đối với các đội ngũ trong nước, hệ quy chiếu về giá ở đây khá rõ ràng. Trong năm qua, các công ty đưa lập trình dạng agent vào quy trình sản xuất thường bị vướng ở khâu tài chính: mô hình viết đúng hay sai từ lâu không còn là vấn đề, mà là hóa đơn hàng ngày với khối lượng gọi lên tới hàng triệu token liệu có được duyệt ký hay không. Điểm số bắt kịp nhóm đầu, giá giảm còn một phần tư, sự kết hợp này có sức nặng thay đổi quyết định mua sắm hơn hẳn việc chỉ hơn 22 điểm.

2,4 nghìn tỷ tham số, 95 tỷ đang hoạt động

Nền tảng phía sau phiên bản 0902 là Qwen3.8-2.4T-A95B. Tổng số tham số là 2,4 nghìn tỷ, nhưng mỗi lượt suy luận chỉ kích hoạt khoảng 95 tỷ — đi theo hướng MoE (hỗn hợp chuyên gia) thưa điển hình: trong số 512 chuyên gia, mỗi token kích hoạt 11 chuyên gia, trong đó 10 chuyên gia định tuyến và 1 chuyên gia dùng chung.

Về mặt kiến trúc, lựa chọn cũng nghiêng về các tác vụ dài hạn. Mô hình có 23 lớp, xen kẽ giữa Gated DeltaNet và Gated Attention, độ dài ngữ cảnh gốc là 262.144 token, có thể mở rộng lên khoảng 1,01 triệu token. Việc kết hợp attention tuyến tính và attention có cổng là hướng đi mà nhiều đội ngũ Trung Quốc làm ngữ cảnh dài đã theo đuổi trong nửa năm qua, với mục tiêu rất rõ ràng: nén chi phí bộ nhớ và suy luận của ngữ cảnh dài xuống mức có thể thương mại hóa được, nếu không thì con số 1 triệu ngữ cảnh chỉ đẹp trên bảng thông số.

Tỷ lệ kích hoạt cũng giải thích con số 5 USD đến từ đâu. Tổng tham số 2,4 nghìn tỷ quyết định dung lượng tri thức của mô hình, còn lượng kích hoạt 95 tỷ quyết định mỗi lần gọi tốn bao nhiêu 'tiền điện'. Với độ thưa ở mức này, chi phí suy luận trên mỗi đơn vị tự nhiên thấp hơn hẳn so với một mô hình dày đặc (dense) có quy mô tương đương.

Đã phủ khắp toàn bộ sản phẩm nội bộ

Phiên bản mới hiện đã có thể gọi trực tiếp qua dịch vụ API trên nền tảng Qwen AI, đồng thời được tích hợp vào Qwen văn phòng, Qoder và ứng dụng Qwen. Ba kênh — khách hàng doanh nghiệp, nhà phát triển và người dùng phổ thông — được thông suốt cùng lúc, không để lại cửa sổ triển khai dần.

Alibaba định vị phiên bản này là 'phù hợp hơn với các tác vụ phức tạp thực tế của doanh nghiệp, nghiên cứu khoa học, tác vụ chu kỳ dài', và cho biết mô hình đã 'lập mức trần mới toàn cầu' trong suy luận nhiều bước, gọi công cụ và tạo ứng dụng đầu-cuối. Vế sau là cách nói của nhà sản xuất, còn vế trước nhắc đến 'tác vụ chu kỳ dài' lại khớp với hai lựa chọn kỹ thuật là ngữ cảnh 1,01 triệu token và kích hoạt thưa — chỉ khi chứa được toàn bộ một codebase trong một lần mà không đốt cháy chi phí, mới có thể nói đến việc để mô hình làm việc liên tục nhiều giờ liền.

Cách đặt tên cũng tiết lộ nhịp độ phát triển. Qwen3.8-Max dùng ngày tháng làm số phiên bản phụ, cho thấy Alibaba đang áp dụng nhịp lặp bước nhỏ, chạy nhanh trên dòng Max mã nguồn đóng: thế hệ mô hình không đổi nhưng năng lực liên tục được bồi đắp thêm. Kể từ khi 3.6-Max chuyển sang đóng mã nguồn, vai trò của dòng Max đã tách khỏi dòng Flash mã nguồn mở: một bên phụ trách chiếm lĩnh bảng xếp hạng và ngân sách doanh nghiệp, một bên phụ trách mở rộng hệ sinh thái nhà phát triển. Lần này phiên bản 0902 đưa giá xuống còn một phần tư nhóm đầu bảng, coi như siết chặt thêm một nấc sự phân công giữa hai dòng sản phẩm.

Nguồn tham khảo: Thông báo chính thức của Alibaba Qwen, CocoLoop, trang bảng xếp hạng lập trình frontend Code Arena, ITHome, thẻ mô hình trên Hugging Face; các số liệu 1691 điểm, mức tăng 22 điểm, giá trung bình mỗi triệu token 5/20/12 USD, tổng tham số 2,4 nghìn tỷ và tham số kích hoạt 95 tỷ đều đã được đối chiếu từng mục.