事件總覽:從 2025 年的首次亮相到 2026 年的深度整合,WEKA 的 Augmented Memory Grid 技術攜手 NVIDIA STX 參考架構,正徹底革新代理型 AI 的情境記憶體效能與成本效益,為 AI 產業開啟大規模推理的新篇章。
📅 2025年 GTC 大會:Augmented Memory Grid 的前瞻性亮相
話說回來,早在 2025 年的 NVIDIA GTC 大會上,AI 儲存與記憶體系統公司 WEKA 便已領先市場一步,首次揭示其革命性的 Augmented Memory Grid 技術。當時,這項技術的推出,便預示著 AI 儲存領域將迎來一場變革,特別是在解決大規模語言模型(LLM)推理過程中,情境記憶體(Context Memory)所面臨的挑戰。這個「記憶體高牆」的問題,其實是每個 AI 叢集擴展時都會遇到的痛點,因為 GPU 上有限的高頻寬記憶體(HBM)很容易耗盡,導致關鍵的鍵值(KV)快取被逐出、情境丟失,進而讓 AI 系統被迫重複計算,大幅拉高了推理成本。
📅 2026年 GTC 大會:NeuralMesh 與 NVIDIA STX 的深度整合
時間來到 2026 年的 NVIDIA GTC 技術大會,WEKA 再次帶來震撼消息。他們宣布已將旗下的 NeuralMesh 軟體與 NVIDIA STX 參考架構進行了深度整合。這項合作無疑是為代理型 AI 工廠量身打造的解決方案,旨在提供高吞吐量的情境記憶儲存,讓跨會話、工具和任務的長語境推理能夠無縫流暢地進行。有趣的是,基於 NVIDIA Vera Rubin NVL72、NVIDIA BlueField-4 及 NVIDIA Spectrum-X 乙太網路的 NeuralMesh 解決方案,預計能將情境記憶體的每秒 Token 生成量提升 4 至 10 倍,同時為 AI 工作負載帶來每秒至少 320 GB 讀取和 150 GB 寫入的吞吐量,這可是傳統 AI 儲存平台吞吐量的兩倍以上。
WEKA 聯合創辦人兼執行長 Liran Zvibel 曾表示:「隨著編碼大型語言模型(LLM)不斷進步,軟體工程領域對代理型 AI 應用的採納程度可謂前所未見,生產力因此提升了 100 到 1,000 倍。當編碼助手反覆調用近乎相同的代碼庫及提示詞時,WEKA 的 Augmented Memory Grid 會重複使用已快取的語境,大幅縮短回應時間,並讓同一基礎建設上支援的並行使用者數目顯著增加。」這番話精準點出了情境記憶儲存的關鍵價值。
📅 目前應用現況:Firmus 的成功實踐
這項技術的潛力,已在業界得到驗證。領先的 AI 創新者及雲端供應商,例如 Firmus,已經開始應用 NeuralMesh 上的 Augmented Memory Grid,成功重塑其推理經濟模式。Firmus 技術長 Daniel Kearney 對此深有體會,他指出:「現實世界的 AI 並非在實驗室執行,而是要面對電力限制、散熱限制,以及源源不絕的工作負載需求。與 NVIDIA AI 基礎建設雙劍合璧之下,WEKA Augmented Memory Grid 可於大規模執行時,實現每秒 Token 數提升 6.5 倍,首個 Token 生成時間(TTFT)加快 4 倍,證明在相同 GPU 配置下,效能可提升至更高層次。」這不僅是數據上的亮眼表現,更是對實際營運效率的巨大貢獻。
至今影響與未來展望
WEKA 的 NeuralMesh 及其 Augmented Memory Grid 技術,結合 NVIDIA STX 參考架構,共同為代理型 AI 的發展奠定了堅實基礎。這種創新的共享鍵值(KV)快取基礎建設,有效解決了推理成本的核心問題,讓情境能在代理、使用者與會話之間保持活躍,從而消除重複計算、維持 Token 吞吐量,並確保效能穩定可測。這意味著企業在擴展代理型系統時,不再會因為記憶體瓶頸而面臨成本急升、使用者體驗下降的困境。
展望未來,隨著代理型工作負載持續增加、情境視窗不斷擴大,那些今日就為持久 KV 快取規劃架構的企業,將比那些觀望的競爭對手取得結構性的成本與效能優勢。WEKA 的這套解決方案,透過 GPU 原生效率、顯著提升的使用者體驗,以及在相同硬體下帶來更高收益的能力,為 AI 雲端、企業及 AI 模型建構者提供了一條清晰的道路,讓 GPU 能以頂尖效能運行,同時實現大規模推理的能源效益與成本效益。截至 2026 年 3 月,Augmented Memory Grid 現已隨 NeuralMesh 一併正式推出市場。









