Google TurboQuant comprime memória de inferência de IA em 6 vezes

Em 25 de março, o Google Research publicou um artigo, e muitas pessoas no Twitter o chamaram de "Pied Piper" – a empresa fictícia da série Silicon Valley que quase mudou a história da internet com um algoritmo de compressão.

A comparação é um pouco exagerada, mas não tão absurda.

A proposta central do TurboQuant: comprimir o uso de memória do KV Cache durante a inferência de grandes modelos em pelo menos 6 vezes, sem retreinamento e sem perda de precisão. Em uma GPU H100, a versão TurboQuant de 4 bits é até 8 vezes mais rápida que o padrão de 32 bits.

O que esse número significa em termos de custo real é simples de calcular.

O que é o KV Cache e por que comprimi-lo

Durante a inferência de grandes modelos (quando você faz uma pergunta e ele está respondendo), é necessário manter uma área de memória chamada KV Cache (cache de chave-valor). Ele armazena os resultados intermediários do mecanismo de atenção, evitando que o modelo tenha que recalcular tudo do zero a cada vez.

O problema é que, quanto maior a janela de contexto, maior o KV Cache. Muitos modelos atuais têm janelas de contexto de milhões de tokens, e o KV Cache pode consumir a maior parte da memória de uma placa A100/H100. Isso limita diretamente quantos usuários podem ser atendidos simultaneamente e a duração das conversas.

Esta é uma das principais razões para o alto custo da inferência de IA.

O objetivo do TurboQuant é comprimir essa memória.

Duas etapas: PolarQuant + QJL

O TurboQuant combina dois algoritmos: PolarQuant e QJL (Quantized Johnson-Lindenstrauss).

Etapa 1 – PolarQuant: Conversão de vetores do sistema de coordenadas cartesianas para coordenadas polares.

Essa conversão tem uma vantagem crucial: nas coordenadas cartesianas, cada direção tem uma faixa de valores diferente, exigindo o armazenamento de um coeficiente de normalização durante a quantização (compressão), o que aumenta o custo de memória. Em coordenadas polares, os dados são decompostos em "magnitude" e "direção", e a direção é mapeada para uma grade circular regular, eliminando a necessidade da etapa de normalização adicional e tornando a perda de precisão mais controlável.

Etapa 2 – QJL: Uso da transformada de Johnson-Lindenstrauss para lidar com o erro residual.

Este método comprime cada valor do vetor para apenas 1 bit de sinal (+1 ou -1), com custo de memória próximo de zero. Combinado com um estimador especialmente calibrado, garante que a precisão do cálculo da pontuação de atenção não seja comprometida.

A combinação das duas etapas comprime cada valor do KV Cache de 16 bits para 3 bits, uma taxa de compressão superior a 6 vezes.

Números-chave de desempenho

Cenário de testeResultado
Taxa de compressão de memória do KV CachePelo menos 6 vezes (teste LongBench sem perda de precisão)
Largura de bits de quantizaçãoDe 16 bits para 3 bits
Aumento de velocidade no H100Versão TurboQuant de 4 bits até 8 vezes mais rápida
Necessidade de retreinamentoNão

Em testes de busca de vetores, o TurboQuant superou consistentemente as linhas de base PQ e RabbitQ na taxa de recall 1@k, enquanto o tempo de construção do índice foi quase insignificante.

Importância e limitações

O CEO da Cloudflare, Matthew Prince, chamou o TurboQuant de "momento DeepSeek do Google". É uma afirmação um tanto forte, mas a perspectiva está correta: o DeepSeek reduziu os custos de treinamento por meio de otimização de engenharia, e o TurboQuant reduz os custos de inferência por meio de algoritmos de compressão. A lógica é a mesma.

No entanto, há uma limitação importante a ser esclarecida: O TurboQuant lida apenas com a memória de inferência, não com a memória de treinamento. Ele não afeta em nada o poder computacional e a memória necessários para treinar grandes modelos. Portanto, não altera o cenário de "quem pode treinar o modelo mais forte", apenas impacta "quanto custa para executar o modelo".

Outra realidade é que o TurboQuant ainda é um resultado de laboratório, a ser apresentado oficialmente no ICLR 2026 (final de abril), e ainda não foi implantado em larga escala em produtos reais. Não há informações públicas sobre se o Google o integrou ao serviço de inferência da linha Gemini.

Ainda há uma distância entre o artigo e o produto – adaptação de engenharia, verificação de estabilidade e testes de regressão são processos demorados. No entanto, considerando que frameworks de inferência populares como o vLLM já têm integrações comunitárias do TurboQuant (implementações de kernel Triton já apareceram no GitHub), o prazo para entrada em ambiente de produção real não deve ser muito longo.

Se for finalmente implementado, o efeito da compressão de memória de 6 vezes combinado com o aumento de velocidade de 8 vezes terá um impacto real na estrutura de custos da inferência de IA – não do tipo "benchmark bonito, inútil na prática".

Os líderes da pesquisa são Amir Zandieh (Research Scientist) e Vahab Mirrokni (Google Fellow, VP).

Fonte de referência: TurboQuant: Redefining AI efficiency with extreme compression (Google Research); Google unveils TurboQuant, a new AI memory compression algorithm (TechCrunch); CocoLoop; Google's TurboQuant compresses AI memory by 6x, rattles chip stocks (The Next Web)