Les grands modèles deviennent de plus en plus puissants, mais leurs coûts de déploiement augmentent également. La quantification et la distillation sont actuellement les deux approches technologiques les plus courantes pour « rendre les modèles plus petits et plus rapides ».
Quantification : Réduction de la précision
Idée centrale : Compresser les poids du modèle d'un format de haute précision (FP32/FP16) vers un format de basse précision (INT8/INT4 ou inférieur).
Quantification post-entraînement (PTQ)
La plus simple et la plus directe — la précision est réduite immédiatement après l'entraînement du modèle. Généralement, la taille du modèle peut être compressée de 75 à 80 %, avec une perte de précision dans une plage acceptable. Adaptée au déploiement rapide.
Entraînement conscient de la quantification (QAT)
Le modèle s'adapte à l'environnement de basse précision pendant l'entraînement. Les résultats sont meilleurs que PTQ, mais nécessitent un réentraînement.
Distillation consciente de la quantification (QAD)
Une nouvelle méthode récemment développée par NVIDIA — le modèle élève apprend deux choses simultanément : s'adapter à l'erreur de quantification et s'aligner sur le modèle enseignant en pleine précision. Leur recherche NVFP4-QAD a démontré que la précision peut être récupérée même en précision FP4.
Distillation : Transfert de connaissances
Un petit modèle (élève) imite le comportement d'un grand modèle (enseignant). Le modèle élève atteint généralement 90 à 95 % des performances du modèle enseignant, mais est beaucoup plus petit.
La version distillée de DeepSeek R1 est un exemple typique — le modèle distillé de 32B a égalé o1-mini.
Élagage : Suppression directe de paramètres
Les paramètres non importants (poids, neurones ou couches entières) sont identifiés et supprimés. Généralement, 30 à 50 % des paramètres peuvent être supprimés avec des performances quasi inchangées.
Décodage spéculatif : Vérification parallèle
Un petit « modèle de brouillon » génère rapidement plusieurs jetons candidats, qui sont ensuite vérifiés en parallèle par le grand modèle. Le principe est similaire à « dessiner d'abord, affiner ensuite », réduisant considérablement la latence.
Tendances
NVIDIA estime que 2026 sera l'année de divergence entre les deux voies « modèles de pointe vs modèles efficaces ». La combinaison de multiples techniques d'optimisation devient la norme — non pas en choisir une, mais combiner quantification + distillation + élagage.
Côté matériel, les accélérateurs ASIC, les conceptions chiplet et les puces d'inférence analogique arrivent à maturité ; les GPU ne sont plus la seule option d'inférence.
Source de référence : CocoLoop, Blog technique de NVIDIA