Lượng tử hóa và chưng cất trở thành công nghệ cốt lõi để đưa mô hình lớn lên thiết bị nhỏ

Các mô hình lớn ngày càng mạnh mẽ, nhưng chi phí triển khai cũng ngày càng cao. Lượng tử hóa và chưng cất hiện là hai hướng công nghệ phổ biến nhất để "làm mô hình nhỏ hơn và nhanh hơn".

Lượng tử hóa: Giảm độ chính xác

Ý tưởng cốt lõi: Nén trọng số mô hình từ định dạng độ chính xác cao (FP32/FP16) xuống định dạng độ chính xác thấp (INT8/INT4 hoặc thấp hơn).

Lượng tử hóa sau huấn luyện (PTQ)
Đơn giản và trực tiếp nhất — giảm độ chính xác ngay sau khi mô hình được huấn luyện xong. Thông thường có thể nén kích thước mô hình xuống 75-80%, với mức suy giảm độ chính xác trong phạm vi chấp nhận được. Phù hợp cho triển khai nhanh.

Huấn luyện nhận thức lượng tử hóa (QAT)
Cho mô hình thích nghi với môi trường độ chính xác thấp ngay trong quá trình huấn luyện. Hiệu quả tốt hơn PTQ, nhưng cần huấn luyện lại.

Chưng cất nhận thức lượng tử hóa (QAD)
Phương pháp mới do NVIDIA phát triển gần đây — mô hình học sinh học đồng thời hai việc: thích nghi với lỗi lượng tử hóa và căn chỉnh với mô hình giáo viên độ chính xác đầy đủ. Nghiên cứu NVFP4-QAD của họ đã chứng minh có thể khôi phục độ chính xác ngay cả ở độ chính xác FP4.

Chưng cất: Chuyển giao kiến thức

Cho mô hình nhỏ (học sinh) bắt chước hành vi của mô hình lớn (giáo viên). Mô hình học sinh thường đạt được 90-95% hiệu suất của mô hình giáo viên, nhưng có kích thước nhỏ hơn nhiều.

Phiên bản chưng cất của DeepSeek R1 là một ví dụ điển hình — mô hình 32B chưng cất đã ngang bằng với o1-mini.

Cắt tỉa: Loại bỏ trực tiếp tham số

Xác định và loại bỏ các tham số không quan trọng (trọng số, nơ-ron hoặc toàn bộ lớp). Thông thường có thể loại bỏ 30-50% tham số mà hiệu suất hầu như không thay đổi.

Giải mã suy luận: Xác minh song song

Sử dụng một "mô hình nháp" nhỏ để nhanh chóng tạo ra nhiều token ứng viên, sau đó cho mô hình lớn xác minh song song. Nguyên lý tương tự như "vẽ thô trước, tinh chỉnh sau", giúp giảm đáng kể độ trễ.

Xu hướng

NVIDIA nhận định năm 2026 sẽ là năm phân hóa giữa hai hướng "mô hình tiên tiến vs mô hình hiệu quả". Việc kết hợp nhiều kỹ thuật tối ưu đang trở thành xu hướng chính — không phải chọn một, mà là kết hợp lượng tử hóa + chưng cất + cắt tỉa.

Về phần cứng, các bộ tăng tốc ASIC, thiết kế chiplet và chip suy luận tương tự đang trưởng thành, GPU không còn là lựa chọn suy luận duy nhất.

Nguồn tham khảo: CocoLoop, Blog kỹ thuật của NVIDIA