Google TurboQuant Kompres Memori Inferensi AI 6 Kali Lipat
TurboQuant dari Google Research mengompres memori KV Cache untuk model bahasa besar setidaknya 6x tanpa perlu pelatihan ulang atau kehilangan akurasi, mencapai akselerasi hingga 8x pada GPU H100.