Google TurboQuant 震撼發布:AI 記憶體壓縮突破,效能狂飆 8 倍!

根據 Google 研究團隊最新發布的權威報告指出,一項名為「TurboQuant」的全新免訓練壓縮演算法,已成功將大型語言模型(LLM)的鍵值快取(KV caches)大幅壓縮至僅剩 3 位元,且過程中模型準確度絲毫未損。這項突破性技術在輝達(Nvidia)H100 GPU 上的基準測試結果令人驚豔,採用 4 位元版本的 TurboQuant,在計算注意力對數時,相較於未經量化的 32 位元金鑰,效能提升了高達 8 倍,同時將 KV 快取記憶體需求量降低了至少 6 倍,為當前 AI 運算龐大的記憶體消耗問題,提供了革命性的硬體最佳化解決方案。

TurboQuant 的技術突破與數據實證

當前 AI 產業正面臨大型語言模型日益擴大的上下文長度所帶來的記憶體瓶頸。在 AI 模型生成文字的過程中,KV 快取扮演著至關重要的角色,它儲存了先前計算過的注意力數據,避免了每個 token 生成時的重複運算。然而,隨著上下文長度不斷增長,KV 快取佔用的記憶體空間也呈現爆炸性成長,成為系統主要的記憶體瓶頸。傳統的向量量化方法雖然能縮減快取體積,卻因額外儲存量化常數而產生消耗,當上下文長度極大時,這些微小的開銷會不斷累加,最終侵蝕掉量化帶來的效益。

Google 團隊為了解決這項挑戰,透過創新的「兩階段處理流程」打造出 TurboQuant 演算法。第一階段導入了 PolarQuant 技術,其核心原理是將數據向量從傳統的 Cartesian 座標轉換為 Polar 座標,巧妙地將每個向量分離成代表大小的 radius 和代表方向的 angles。由於在極座標下,angles 的分布具有高度可預測性且非常集中,PolarQuant 得以直接省略傳統量化器必須執行的、極度消耗運算資源的每區塊正規化步驟。這項設計使得模型在達成高品質壓縮的同時,實現了零量化常數儲存消耗的驚人成果。

第二階段則是一層 1 位元錯誤修正層,採用了名為 Quantized Johnson-Lindenstrauss (QJL) 的演算法。QJL 演算法會將殘餘的量化誤差投影到一個較低維度的空間之中,接著將每個數值進一步縮減至僅剩一個單一符號位元。這項數學轉換幾乎沒有增加任何額外的運算成本,同時還能有效消除在計算注意力分數時所產生的系統性偏差,確保模型的高精準度。

「TurboQuant 最具商業價值的優勢在於它完全不需要任何訓練或微調,且在執行時期的資源消耗微乎其微。」—— Google 官方特別強調,這使得該技術能非常輕易且無縫地部署於現有的生產級推論系統及大規模向量搜尋系統之中。

跨模型與基準測試的卓越表現

為了驗證實際效能,Google 團隊使用了 Gemma 與 Mistral 等開源模型,在多個業界標準的長文本基準測試中進行了全面評估,涵蓋了 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 以及 L-Eval 等項目。數據顯示,在 LongBench 的資訊檢索任務中,即使在將 KV 記憶體壓縮至少 6 倍的嚴苛條件下,TurboQuant 依然取得了完美的下游分數。此外,在包含問答、程式碼生成以及文章摘要等多元任務的 LongBench 測試中,TurboQuant 的表現不僅追平,甚至在所有任務上都超越了 KIVI 基準線,展現其在多任務處理上的強大適應性與優越性。

向量搜尋領域的應用潛力

除了大型語言模型,TurboQuant 在向量搜尋領域也展現了強大的實力。在 GloVe 資料集的評測中,即使面對如 Product Quantization 和 RabbiQ 等依賴龐大碼本與特定資料集微調的現有基準技術,TurboQuant 依舊取得了最高的 1@k 召回率(recall ratios)。這項成果凸顯了 TurboQuant 在處理高維度向量資料時的效率與精準度,對於需要快速、準確檢索大量相似資訊的應用場景,其潛力不容小覷。

這項技術的詳細研究論文由 Google 研究科學家 Amir Zandieh 與副總裁 Vahab Mirrokni 共同撰寫,預計將於下個月舉辦的 2026 年國際學習表徵會議(ICLR 2026)上正式發表,屆時將為全球 AI 領域帶來更多細節與討論。

數據背後的啟示:AI 運算門檻大幅降低

Google TurboQuant 演算法的問世,無疑為 AI 運算領域帶來了深遠的影響。透過將大型語言模型的 KV 快取大幅壓縮,不僅能顯著降低記憶體消耗,更提升了整體效能達 8 倍之多。這項免訓練且資源消耗微乎其微的技術,意味著未來開發者和企業能以更低的硬體成本、更快的速度部署和運行大型 AI 模型,有效降低了 AI 技術普及的門檻。可以預見,隨著 TurboQuant 這類創新技術的廣泛應用,AI 模型的運算效率將達到一個新的里程碑,進一步加速人工智慧在各行各業的落地與創新。