Google TurboQuant comprime memória de inferência de IA em 6 vezes
O Google Research apresentou o TurboQuant, que combina os algoritmos PolarQuant e QJL para comprimir a memória do KV Cache durante a inferência de grandes modelos em pelo menos 6 vezes sem necessidade de retreinamento, alcançando até 8 vezes mais velocidade em GPUs H100.