Google 2026-04-20 Google TurboQuant, AI 추론 메모리 6배 압축 Google Research의 TurboQuant는 재학습이나 정확도 손실 없이 대규모 언어 모델의 KV Cache 메모리를 최소 6배 압축하며, H100 GPU에서 최대 8배 속도 향상을 달성합니다. #AI 추론 최적화#대규모 모델 효율성#기술 혁신