3 月 25 日,Google Research 發表了一篇論文,隨後許多人在推特上稱之為「Pied Piper」——也就是影集《矽谷》裡那家靠壓縮演算法差點改變網際網路歷史的虛構公司。
這個類比有點誇張,但也不算離譜。
TurboQuant 的核心主張:將大模型推理時的 KV Cache 記憶體佔用壓縮至少 6 倍,無需重新訓練,且不損失精度。 在 H100 GPU 上,4-bit TurboQuant 版本的執行速度最高比標準 32-bit 快 8 倍。
這個數字放到實際成本裡意味著什麼,算起來很簡單。
KV Cache 是什麼,為什麼要壓縮它
大模型在推理時(也就是你問它問題、它在回答你的那個階段),需要維護一塊執行記憶體稱為 KV Cache(鍵值快取)。它儲存了注意力機制裡的中間計算結果,讓模型不必每次都從頭重算。
問題在於,上下文視窗越長,KV Cache 就越大。現在許多模型動輒數百萬 token 的上下文,KV Cache 可能吃掉一塊 A100/H100 顯示卡裡的大部分視訊記憶體。這直接限制了能同時服務多少使用者、能跑多長的對話。
這也是 AI 推理成本居高不下的重要原因之一。
TurboQuant 的目標就是將這塊記憶體壓縮下來。
兩步驟:PolarQuant + QJL
TurboQuant 由兩個演算法組合而成:PolarQuant 和 QJL(Quantized Johnson-Lindenstrauss)。
第一步 - PolarQuant: 將向量從直角座標系轉換成極座標系。
這個轉換有個關鍵好處:原本在直角座標裡,每個方向的數值範圍不一樣,量化(壓縮)時需要記錄一個歸一化係數,增加了記憶體開銷。換成極座標之後,資料被分解成「大小」和「方向」兩個部分,方向映射到一個規則的圓形網格上,不再需要那個額外的歸一化步驟,精度損失也更可控。
第二步 - QJL: 使用 Johnson-Lindenstrauss 變換處理剩餘誤差。
這個方法將每個向量數值壓縮到只有 1 個符號位元(+1 或 -1),記憶體開銷接近零。搭配一個專門校準過的估算器,確保注意力分數計算時的準確性不出問題。
兩步驟疊加,最終將 KV Cache 每個值從 16 位元壓到 3 位元,壓縮比 6 倍以上。
關鍵效能數字
| 測試場景 | 結果 |
|---|---|
| KV Cache 記憶體壓縮比 | 至少 6 倍(LongBench 測試無精度損失) |
| 量化位元寬度 | 從 16-bit 壓到 3-bit |
| H100 速度提升 | 4-bit TurboQuant 版本最高 8 倍加速 |
| 是否需要重新訓練 | 不需要 |
向量搜尋方向的測試中,TurboQuant 在 1@k 召回率上持續優於 PQ 和 RabbitQ 基線,同時建立索引的時間幾乎可以忽略不計。
有多重要,有什麼限制
Cloudflare CEO Matthew Prince 將 TurboQuant 稱為「Google 的 DeepSeek 時刻」。這話說得有點重,不過角度是對的:DeepSeek 靠工程最佳化把訓練成本砍了一大截,TurboQuant 靠壓縮演算法把推理成本往下打。邏輯是一樣的。
但這裡有個重要的限制要說清楚:TurboQuant 只管推理記憶體,不管訓練記憶體。 訓練大模型需要的算力和視訊記憶體,它完全沒碰。所以它不會改變「誰能訓練出最強模型」這個格局,只會影響「模型跑起來要花多少錢」。
另一個現實是,TurboQuant 目前還是實驗室成果,將在 ICLR 2026(4 月下旬)正式發表,尚未大規模部署到真實產品中。Google 有沒有把它用進 Gemini 系列的推理服務裡,目前沒有公開消息。
從論文到產品之間還有一段距離——工程適配、穩定性驗證、回歸測試都是耗時間的事。不過考慮到 vLLM 等主流推理框架已經有社群在做 TurboQuant 的整合(GitHub 上已經出現了 Triton 核心實作),進入實際生產環境的時間線應該不會太長。
如果最終落地,6 倍記憶體壓縮疊加 8 倍速度提升的效果,對 AI 推理的成本結構是真正的影響——不是那種「跑分好看、實際沒用」的那種。
研究負責人是 Amir Zandieh(研究科學家)和 Vahab Mirrokni(Google Fellow、VP)。
參考來源:TurboQuant: Redefining AI efficiency with extreme compression(Google Research);Google unveils TurboQuant, a new AI memory compression algorithm(TechCrunch);CocoLoop、Google's TurboQuant compresses AI memory by 6x, rattles chip stocks(The Next Web)