Google TurboQuant 將 AI 推理記憶體壓縮 6 倍

3 月 25 日,Google Research 發表了一篇論文,隨後許多人在推特上稱之為「Pied Piper」——也就是影集《矽谷》裡那家靠壓縮演算法差點改變網際網路歷史的虛構公司。

這個類比有點誇張,但也不算離譜。

TurboQuant 的核心主張:將大模型推理時的 KV Cache 記憶體佔用壓縮至少 6 倍,無需重新訓練,且不損失精度。 在 H100 GPU 上,4-bit TurboQuant 版本的執行速度最高比標準 32-bit 快 8 倍。

這個數字放到實際成本裡意味著什麼,算起來很簡單。

KV Cache 是什麼,為什麼要壓縮它

大模型在推理時(也就是你問它問題、它在回答你的那個階段),需要維護一塊執行記憶體稱為 KV Cache(鍵值快取)。它儲存了注意力機制裡的中間計算結果,讓模型不必每次都從頭重算。

問題在於,上下文視窗越長,KV Cache 就越大。現在許多模型動輒數百萬 token 的上下文,KV Cache 可能吃掉一塊 A100/H100 顯示卡裡的大部分視訊記憶體。這直接限制了能同時服務多少使用者、能跑多長的對話。

這也是 AI 推理成本居高不下的重要原因之一。

TurboQuant 的目標就是將這塊記憶體壓縮下來。

兩步驟:PolarQuant + QJL

TurboQuant 由兩個演算法組合而成:PolarQuantQJL(Quantized Johnson-Lindenstrauss)

第一步 - PolarQuant: 將向量從直角座標系轉換成極座標系。

這個轉換有個關鍵好處:原本在直角座標裡,每個方向的數值範圍不一樣,量化(壓縮)時需要記錄一個歸一化係數,增加了記憶體開銷。換成極座標之後,資料被分解成「大小」和「方向」兩個部分,方向映射到一個規則的圓形網格上,不再需要那個額外的歸一化步驟,精度損失也更可控。

第二步 - QJL: 使用 Johnson-Lindenstrauss 變換處理剩餘誤差。

這個方法將每個向量數值壓縮到只有 1 個符號位元(+1 或 -1),記憶體開銷接近零。搭配一個專門校準過的估算器,確保注意力分數計算時的準確性不出問題。

兩步驟疊加,最終將 KV Cache 每個值從 16 位元壓到 3 位元,壓縮比 6 倍以上。

關鍵效能數字

測試場景結果
KV Cache 記憶體壓縮比至少 6 倍(LongBench 測試無精度損失)
量化位元寬度從 16-bit 壓到 3-bit
H100 速度提升4-bit TurboQuant 版本最高 8 倍加速
是否需要重新訓練不需要

向量搜尋方向的測試中,TurboQuant 在 1@k 召回率上持續優於 PQ 和 RabbitQ 基線,同時建立索引的時間幾乎可以忽略不計。

有多重要,有什麼限制

Cloudflare CEO Matthew Prince 將 TurboQuant 稱為「Google 的 DeepSeek 時刻」。這話說得有點重,不過角度是對的:DeepSeek 靠工程最佳化把訓練成本砍了一大截,TurboQuant 靠壓縮演算法把推理成本往下打。邏輯是一樣的。

但這裡有個重要的限制要說清楚:TurboQuant 只管推理記憶體,不管訓練記憶體。 訓練大模型需要的算力和視訊記憶體,它完全沒碰。所以它不會改變「誰能訓練出最強模型」這個格局,只會影響「模型跑起來要花多少錢」。

另一個現實是,TurboQuant 目前還是實驗室成果,將在 ICLR 2026(4 月下旬)正式發表,尚未大規模部署到真實產品中。Google 有沒有把它用進 Gemini 系列的推理服務裡,目前沒有公開消息。

從論文到產品之間還有一段距離——工程適配、穩定性驗證、回歸測試都是耗時間的事。不過考慮到 vLLM 等主流推理框架已經有社群在做 TurboQuant 的整合(GitHub 上已經出現了 Triton 核心實作),進入實際生產環境的時間線應該不會太長。

如果最終落地,6 倍記憶體壓縮疊加 8 倍速度提升的效果,對 AI 推理的成本結構是真正的影響——不是那種「跑分好看、實際沒用」的那種。

研究負責人是 Amir Zandieh(研究科學家)和 Vahab Mirrokni(Google Fellow、VP)。

參考來源:TurboQuant: Redefining AI efficiency with extreme compression(Google Research);Google unveils TurboQuant, a new AI memory compression algorithm(TechCrunch);CocoLoop、Google's TurboQuant compresses AI memory by 6x, rattles chip stocks(The Next Web)