Google TurboQuant komprimiert KI-Inferenzspeicher um das 6-Fache
Google Research stellt TurboQuant vor, das mit den beiden Algorithmen PolarQuant und QJL den KV-Cache-Speicher bei der Inferenz großer Modelle um mindestens das Sechsfache komprimiert, ohne dass ein erneutes Training erforderlich ist, und auf H100-GPUs eine bis zu 8-fache Beschleunigung erreicht.