Qwen3.8-Flash-Next mã nguồn mở tối nay, kiến trúc đi trước đến Qwen4

Cộng đồng ModelScope đã đăng trang giới thiệu (teaser) cho Qwen3.8-Flash-Next, đồng hồ đếm ngược chỉ đến 23h ngày 26/8 (UTC+8), bản tiêu chuẩn và bản FP8 mở tải xuống cùng lúc. Kho lưu trữ cùng tên trên Hugging Face chỉ có một câu mô tả duy nhất: A Preview of the Qwen4 Architecture (Bản xem trước của kiến trúc Qwen4).

Cấu hình tham số rò rỉ từ trang giới thiệu là: 125 tỷ tham số chính, thêm 51 tỷ embedding N-gram, mỗi token kích hoạt 6 tỷ tham số. Mô hình được định vị là MoE đa phương thức, theo tuyên bố chính thức thì nó được xây trên kiến trúc Qwen4 thế hệ kế tiếp, mã nguồn mở hóa tiến độ kiến trúc trước để cộng đồng chuẩn bị đón dòng Qwen4.

Tỷ lệ kích hoạt bị nén xuống dưới 5%

Trong 125 tỷ chỉ kích hoạt 6 tỷ, tỷ lệ kích hoạt tính sơ bộ chưa đến 5%. Để so sánh, các mô hình MoE thưa phổ biến trong ngành hai năm qua phần lớn rơi vào khoảng 5% đến 10%, Flash-Next đẩy độ thưa xuống thêm một nấc nữa.

Đây là một cấu hình rõ ràng nhắm vào chi phí suy luận. Dung lượng bộ nhớ (VRAM) của MoE phụ thuộc tổng tham số, còn khối lượng tính toán phụ thuộc tham số được kích hoạt — 125 tỷ trọng số phải nạp vào VRAM, nhưng mỗi lượt lan truyền xuôi chỉ đi qua đường dẫn 6 tỷ. Ở phía triển khai, điều này có nghĩa là: ngưỡng dung lượng card đồ họa không giảm, nhưng ngưỡng năng lực tính toán và độ trễ giảm mạnh. Cộng thêm bản FP8, dung lượng trọng số có thể cắt thêm khoảng một nửa. Chữ Flash trong tên gọi có lẽ ám chỉ chính điều này.

Điểm hiếm gặp trong bảng tham số là khối embedding N-gram 51 tỷ, được tách riêng khỏi tham số chính. Các cấu trúc dạng embedding thường chủ yếu là tra bảng, không tham gia vào phép nhân ma trận theo từng lớp — nếu Flash-Next cũng đi theo hướng này thì 51 tỷ đó giống một khoản đầu tư đổi VRAM lấy hiệu quả hơn là chi phí tính toán — cách triển khai cụ thể phải chờ model card và tệp cấu hình được công bố tối nay mới xác nhận được.

Vì sao mang số "3.8" nhưng lại dùng kiến trúc Qwen4

Tên gọi nhìn có vẻ gượng nhưng logic lại nhất quán. Đây không phải lần đầu Qwen đặt một bản xem trước Next vào cuối chuỗi 3.x, công thức vẫn vậy: lấy cách định tuyến, biến thể attention, chuỗi huấn luyện của thế hệ kế tiếp, chạy thử trên một mô hình cỡ vừa rồi mã nguồn mở, để cộng đồng thích ứng chuỗi công cụ trước, phiên bản lớn chính thức mới tung ra sau.

Lợi ích khá thực tế. Một mô hình mã nguồn mở có được các khung như vLLM, SGLang, llama.cpp tiếp nhận ngay ngày ra mắt hay không, phần lớn quyết định đường cong áp dụng trong hai tuần đầu. Một khi kiến trúc có toán tử mới, cách định tuyến mới, việc thích ứng thường kéo dài nhiều tuần. Unsloth đã công bố đang làm hỗ trợ day-zero, đi đúng theo hướng này — dời chi phí thời gian thích ứng kiến trúc từ ngày Qwen4 ra mắt sang ngay hôm nay.

Kho lưu trữ đó trên Hugging Face, trước khi mở đã có 1.299 người bấm nhận thông báo, con số này không hề thấp đối với một kho trống còn chưa có cả model card.

Sau tối nay nên theo dõi những gì

Thông tin trên trang giới thiệu dừng lại ở số lượng tham số, vài chỉ số then chốt chưa hé lộ: độ dài ngữ cảnh, đa phương thức bao phủ đến những dạng nào, giấy phép có tiếp tục là Apache 2.0 hay không, và quan trọng nhất — kết quả đánh giá (benchmark).

Cách chơi của Alibaba ở mảng mã nguồn mở suốt năm qua là biến trọng số thành cửa ngõ hệ sinh thái, trọng số của mô hình cấp Max cũng đã được công bố. Flash-Next lần này lại đẩy dòng thời gian lên sớm hơn nữa: chưa đợi mô hình chín muồi đã công bố kiến trúc trước. Với các đội làm triển khai suy luận và tinh chỉnh trong nước, 48 giờ đầu sau 23h tối nay sẽ khá bận rộn.

Nguồn tham khảo: trang mô hình ModelScope, kho lưu trữ Hugging Face, CocoLoop, Decrypt, thảo luận cộng đồng Hacker News; cấu hình tham số và thời gian mở đều theo thông tin hiển thị trên trang mô hình, tỷ lệ kích hoạt là tính sơ bộ theo tham số công khai.