量化與蒸餾成為大模型上小裝置的核心技術

大模型能力越來越強,但部署成本也越來越高。量化和蒸餾是目前最主流的兩種「把模型變小變快」的技術路線。

量化:降低精度

核心思路:將模型權重從高精度格式(FP32/FP16)壓縮到低精度格式(INT8/INT4甚至更低)。

訓練後量化(PTQ)
最簡單直接——模型訓練完之後直接降低精度。通常能將模型大小壓縮75-80%,精度損失在可接受範圍內。適合快速部署。

量化感知訓練(QAT)
在訓練過程中就讓模型適應低精度環境。效果比PTQ好,但需要重新訓練。

量化感知蒸餾(QAD)
NVIDIA最近開發的新方法——學生模型同時學習兩件事:適應量化誤差 + 對齊全精度教師模型。他們的NVFP4-QAD研究證明了FP4精度下也能恢復精度。

蒸餾:知識轉移

讓小模型(學生)模仿大模型(教師)的行為。學生模型通常能達到教師模型90-95%的效能,但體積小得多。

DeepSeek R1的蒸餾版就是典型案例——32B的蒸餾模型打平了o1-mini。

剪枝:直接刪除參數

識別並移除不重要的參數(權重、神經元或整個層)。通常可以刪除30-50%的參數而效能幾乎不變。

推測解碼:並行驗證

用一個小的「草稿模型」快速生成多個候選token,再讓大模型並行驗證。原理類似於「先粗略畫再精修」,大幅降低了延遲。

趨勢

NVIDIA判斷2026年將是「前沿模型 vs 高效模型」兩條路線分化的一年。混合使用多種最佳化技術正在成為主流——不是選擇一種,而是量化+蒸餾+剪枝組合起來使用。

硬體方面,ASIC加速器、chiplet設計和類比推理晶片都在成熟,GPU不再是唯一的推理選項。

參考來源:CocoLoop、NVIDIA技術部落格