El 25 de marzo, Google Research publicó un artículo, y mucha gente en Twitter lo llamó "Pied Piper", la empresa ficticia de la serie Silicon Valley que casi cambió la historia de Internet con un algoritmo de compresión.
La comparación es un poco exagerada, pero no tan descabellada.
La propuesta central de TurboQuant: comprimir el uso de memoria del KV Cache durante la inferencia de modelos grandes al menos 6 veces, sin reentrenamiento y sin pérdida de precisión. En una GPU H100, la versión TurboQuant de 4 bits es hasta 8 veces más rápida que el estándar de 32 bits.
Lo que esta cifra significa en términos de costos reales es fácil de calcular.
Qué es el KV Cache y por qué comprimirlo
Durante la inferencia de modelos grandes (cuando usted hace una pregunta y el modelo está respondiendo), se necesita mantener un área de memoria llamada KV Cache (caché de clave-valor). Almacena los resultados intermedios del mecanismo de atención, evitando que el modelo tenga que recalcular todo desde cero cada vez.
El problema es que, cuanto más larga es la ventana de contexto, más grande es el KV Cache. Muchos modelos actuales tienen ventanas de contexto de millones de tokens, y el KV Cache puede consumir la mayor parte de la memoria de una tarjeta A100/H100. Esto limita directamente cuántos usuarios pueden ser atendidos simultáneamente y la duración de las conversaciones.
Esta es una de las principales razones del alto costo de la inferencia de IA.
El objetivo de TurboQuant es comprimir esta memoria.
Dos pasos: PolarQuant + QJL
TurboQuant combina dos algoritmos: PolarQuant y QJL (Quantized Johnson-Lindenstrauss).
Paso 1 – PolarQuant: Conversión de vectores del sistema de coordenadas cartesianas a coordenadas polares.
Esta conversión tiene una ventaja crucial: en coordenadas cartesianas, cada dirección tiene un rango de valores diferente, lo que requiere almacenar un coeficiente de normalización durante la cuantización (compresión), aumentando el costo de memoria. En coordenadas polares, los datos se descomponen en "magnitud" y "dirección", y la dirección se asigna a una cuadrícula circular regular, eliminando la necesidad del paso de normalización adicional y haciendo que la pérdida de precisión sea más controlable.
Paso 2 – QJL: Uso de la transformada de Johnson-Lindenstrauss para manejar el error residual.
Este método comprime cada valor del vector a solo 1 bit de signo (+1 o -1), con un costo de memoria cercano a cero. Combinado con un estimador especialmente calibrado, garantiza que la precisión del cálculo de la puntuación de atención no se vea comprometida.
La combinación de ambos pasos comprime cada valor del KV Cache de 16 bits a 3 bits, una tasa de compresión superior a 6 veces.
Cifras clave de rendimiento
| Escenario de prueba | Resultado |
|---|---|
| Tasa de compresión de memoria del KV Cache | Al menos 6 veces (prueba LongBench sin pérdida de precisión) |
| Ancho de bits de cuantización | De 16 bits a 3 bits |
| Aumento de velocidad en H100 | Versión TurboQuant de 4 bits hasta 8 veces más rápida |
| ¿Necesita reentrenamiento? | No |
En pruebas de búsqueda de vectores, TurboQuant superó consistentemente a las líneas base PQ y RabbitQ en la tasa de recuperación 1@k, mientras que el tiempo de construcción del índice fue casi insignificante.
Importancia y limitaciones
El CEO de Cloudflare, Matthew Prince, llamó a TurboQuant el "momento DeepSeek de Google". Es una afirmación un tanto fuerte, pero la perspectiva es correcta: DeepSeek redujo los costos de entrenamiento mediante optimización de ingeniería, y TurboQuant reduce los costos de inferencia mediante algoritmos de compresión. La lógica es la misma.
Sin embargo, hay una limitación importante que aclarar: TurboQuant solo maneja la memoria de inferencia, no la memoria de entrenamiento. No afecta en absoluto la potencia computacional y la memoria necesarias para entrenar modelos grandes. Por lo tanto, no cambia el panorama de "quién puede entrenar el modelo más fuerte", solo impacta "cuánto cuesta ejecutar el modelo".
Otra realidad es que TurboQuant sigue siendo un resultado de laboratorio, que se presentará oficialmente en ICLR 2026 (finales de abril), y aún no se ha implementado a gran escala en productos reales. No hay información pública sobre si Google lo ha integrado en el servicio de inferencia de la línea Gemini.
Todavía hay una distancia entre el artículo y el producto: la adaptación de ingeniería, la verificación de estabilidad y las pruebas de regresión son procesos que requieren tiempo. Sin embargo, considerando que frameworks de inferencia populares como vLLM ya tienen integraciones comunitarias de TurboQuant (ya han aparecido implementaciones de kernel Triton en GitHub), el plazo para la entrada en un entorno de producción real no debería ser demasiado largo.
Si finalmente se implementa, el efecto de la compresión de memoria de 6 veces combinado con el aumento de velocidad de 8 veces tendrá un impacto real en la estructura de costos de la inferencia de IA, no del tipo "benchmark bonito, inútil en la práctica".
Los líderes de la investigación son Amir Zandieh (Research Scientist) y Vahab Mirrokni (Google Fellow, VP).
Fuente de referencia: TurboQuant: Redefining AI efficiency with extreme compression (Google Research); Google unveils TurboQuant, a new AI memory compression algorithm (TechCrunch); CocoLoop; Google's TurboQuant compresses AI memory by 6x, rattles chip stocks (The Next Web)