Google TurboQuant comprime la memoria de inferencia de IA 6 veces
Google Research presenta TurboQuant, que combina los algoritmos PolarQuant y QJL para comprimir la memoria del KV Cache durante la inferencia de modelos grandes al menos 6 veces sin necesidad de reentrenamiento, logrando hasta 8 veces más velocidad en GPU H100.