Google TurboQuant nén bộ nhớ suy luận AI xuống 6 lần
Google Research công bố TurboQuant, kết hợp hai thuật toán PolarQuant và QJL để nén KV Cache trong suy luận mô hình lớn ít nhất 6 lần mà không cần huấn luyện lại, đạt tốc độ nhanh hơn tới 8 lần trên GPU H100.