Google 2026-04-20 Google TurboQuant 將 AI 推理記憶體壓縮 6 倍 Google Research 的 TurboQuant 可在無需重新訓練、不損失精度的情況下,將大型語言模型推理時的 KV Cache 記憶體佔用壓縮至少 6 倍,並在 H100 GPU 上實現最高 8 倍加速。 #AI 推理最佳化#大模型效率#技術突破