Google 稱 AI 伺服器記憶體成本破 75%,推軟硬體雙軌策略
ChainCatcher 消息,SEMICON Taiwan 2026 記憶體高峰論壇 1 日登場,Alphabet 旗下 Google Cloud 供應鏈基礎架構資深總監 Nikhil Cherian 指出,隨著多模態與混合專家架構普及,AI 計算已從算力受限轉向記憶體受限,高效能記憶體已占 AI 伺服器硬體物料清單成本 75% 以上。面對容量、頻寬與功耗瓶頸,Google 透過推論與訓練硬體分流、無損量化軟體演算法等軟硬體雙軌策略,突破 AI 記憶體瓶頸。
Google 在硬體架構上採取分流策略,推出針對低延遲推論的 TPU 8i 以及專攻超大規模訓練的 TPU 8t。TPU 8i 配備 288 GB 高頻寬記憶體,晶片上 SRAM 容量擴增 3 倍至 384 MiB,將動態對話狀態與鍵值快取置於晶片內部,實現零晶片外延遲。TPU 8t 透過 9600 顆晶片組成超大型運算叢集,HBM 共享池化達到 2 PB 規模,消除晶片外數據傳輸瓶頸,搭配 TPU Direct Storage 技術。
Google 開發出免訓練的 TurboQuant 無損量化演算法,將大模型的鍵值快取從 32 位元壓縮至 3 位元,精確度零損失前提下縮小 6 倍記憶體佔用,帶來 8 倍注意力運算加速,導入舊世代 DRAM 整合技術延長零組件生命周期。






