Google TurboQuant comprime la mémoire d'inférence IA par 6
Google Research dévoile TurboQuant, qui combine les algorithmes PolarQuant et QJL pour compresser la mémoire du cache KV lors de l'inférence de grands modèles d'au moins 6 fois sans réentraînement, atteignant jusqu'à 8 fois plus de vitesse sur GPU H100.