Google TurboQuant, AI 추론 메모리 6배 압축

3월 25일, Google Research가 논문을 발표했고, 트위터에서는 많은 사람들이 이를 "Pied Piper"라고 불렀습니다. 이는 TV 드라마 실리콘 밸리에 등장하는, 압축 알고리즘으로 인터넷의 역사를 바꿀 뻔한 가상의 회사입니다.

이 비유는 다소 과장되었지만, 완전히 틀린 말은 아닙니다.

TurboQuant의 핵심 주장: 대규모 모델 추론 시 KV Cache 메모리 사용량을 재학습 없이, 정확도 손실 없이 최소 6배 압축합니다. H100 GPU에서 4비트 TurboQuant 버전은 표준 32비트 버전보다 최대 8배 빠르게 실행됩니다.

이 수치가 실제 비용에서 의미하는 바는 간단히 계산할 수 있습니다.

KV Cache란 무엇이며 왜 압축해야 하는가

대규모 모델은 추론 시(사용자가 질문하고 모델이 답변을 생성하는 단계) KV Cache(키-값 캐시)라는 작업 메모리를 유지합니다. 이는 어텐션 메커니즘의 중간 계산 결과를 저장하여 모델이 매번 처음부터 다시 계산할 필요가 없게 합니다.

문제는 컨텍스트 윈도우가 길어질수록 KV Cache가 커진다는 점입니다. 현재 많은 모델이 수백만 토큰의 컨텍스트 윈도우를 처리하며, KV Cache는 A100 또는 H100 GPU의 비디오 메모리 대부분을 소비할 수 있습니다. 이는 동시에 서비스할 수 있는 사용자 수와 실행 가능한 대화 길이를 직접적으로 제한합니다.

이것은 또한 AI 추론 비용이 높게 유지되는 주요 원인 중 하나입니다.

TurboQuant는 이 메모리를 압축하는 것을 목표로 합니다.

2단계 접근법: PolarQuant + QJL

TurboQuant는 두 가지 알고리즘을 결합합니다: PolarQuantQJL(Quantized Johnson-Lindenstrauss)입니다.

1단계 - PolarQuant: 벡터를 직교 좌표계에서 극좌표계로 변환합니다.

이 변환에는 중요한 이점이 있습니다. 직교 좌표에서는 각 방향의 숫자 범위가 달라 양자화(압축) 시 정규화 계수를 기록해야 하므로 메모리 오버헤드가 증가합니다. 극좌표로 변환하면 데이터는 "크기"와 "방향"의 두 구성 요소로 분해됩니다. 방향은 규칙적인 원형 그리드에 매핑되어 추가 정규화 단계가 필요 없게 되고, 정밀도 손실도 더 잘 제어할 수 있습니다.

2단계 - QJL: Johnson-Lindenstrauss 변환을 사용하여 잔차 오차를 처리합니다.

이 방법은 각 벡터 값을 단 1개의 부호 비트(+1 또는 -1)로 압축하여 메모리 오버헤드가 거의 0에 가깝습니다. 특별히 보정된 추정기와 결합하여 어텐션 점수 계산의 정확성을 보장합니다.

이 두 단계를 통해 KV Cache의 각 값이 16비트에서 3비트로 압축되어 6배 이상의 압축률을 달성합니다.

주요 성능 수치

테스트 시나리오결과
KV Cache 메모리 압축률최소 6배 (LongBench 테스트에서 정확도 손실 없음)
양자화 비트 폭16비트에서 3비트로
H100 속도 향상4비트 TurboQuant 버전에서 최대 8배 가속
재학습 필요 여부필요 없음

벡터 검색 테스트에서 TurboQuant는 1@k 재현율에서 PQ 및 RabbitQ 기준선을 지속적으로 능가했으며, 인덱스 구축 시간은 거의 무시할 수준이었습니다.

중요성과 한계

Cloudflare CEO Matthew Prince는 TurboQuant를 "Google의 DeepSeek 순간"이라고 불렀습니다. 다소 과한 표현이지만, 논리는 타당합니다. DeepSeek은 엔지니어링 최적화를 통해 훈련 비용을 대폭 줄였고, TurboQuant는 압축 알고리즘을 통해 추론 비용을 낮춥니다. 그 논리는 동일합니다.

하지만 명확히 해야 할 중요한 한계가 있습니다. TurboQuant는 추론 메모리만 다루며, 훈련 메모리는 다루지 않습니다. 대규모 모델 훈련에 필요한 연산 능력이나 메모리에는 전혀 영향을 미치지 않습니다. 따라서 누가 가장 강력한 모델을 훈련할 수 있는지라는 구도는 바꾸지 않고, 모델 실행 비용에만 영향을 미칩니다.

또 다른 현실은 TurboQuant가 아직 실험실 단계의 결과물이라는 점입니다. 2026년 4월 말 ICLR 2026에서 공식 발표될 예정이며, 아직 실제 제품에 대규모로 배포되지는 않았습니다. Google이 이를 Gemini 시리즈 추론 서비스에 통합했는지에 대한 공개된 정보는 현재 없습니다.

논문에서 제품까지는 아직 거리가 있습니다. 엔지니어링 적응, 안정성 검증, 회귀 테스트 모두 시간이 소요됩니다. 그러나 vLLM 등 주요 추론 프레임워크에서 이미 커뮤니티 차원의 TurboQuant 통합 작업이 진행 중이며(GitHub에 Triton 커널 구현이 등장했습니다), 실제 프로덕션 환경 도입까지의 시간은 그리 길지 않을 것으로 보입니다.

최종적으로 실용화된다면, 6배 메모리 압축과 최대 8배 속도 향상의 결합 효과는 AI 추론의 비용 구조에 실질적인 영향을 미칠 것입니다. "벤치마크에서는 좋지만 실제로는 쓸모없는" 그런 종류의 결과가 아닙니다.

연구 책임자는 Amir Zandieh(연구 과학자)와 Vahab Mirrokni(Google Fellow, VP)입니다.

출처: TurboQuant: Redefining AI efficiency with extreme compression (Google Research); Google unveils TurboQuant, a new AI memory compression algorithm (TechCrunch); CocoLoop; Google's TurboQuant compresses AI memory by 6x, rattles chip stocks (The Next Web)