BTC $77,519.28 -1.50%
ETH $2,414.37 -2.22%
BNB $687.28 -0.74%
XRP $1.35 -2.39%
SOL $100.03 -3.47%
TRX $0.3219 -2.99%
DOGE $0.0817 -1.74%
ADA $0.1971 -1.85%
BCH $248.64 +0.33%
LINK $11.24 -1.61%
HYPE $83.04 -1.04%
AAVE $132.04 +4.76%
SUI $0.7229 -0.88%
XLM $0.1756 -1.25%
ZEC $837.99 -1.55%
BTC $77,519.28 -1.50%
ETH $2,414.37 -2.22%
BNB $687.28 -0.74%
XRP $1.35 -2.39%
SOL $100.03 -3.47%
TRX $0.3219 -2.99%
DOGE $0.0817 -1.74%
ADA $0.1971 -1.85%
BCH $248.64 +0.33%
LINK $11.24 -1.61%
HYPE $83.04 -1.04%
AAVE $132.04 +4.76%
SUI $0.7229 -0.88%
XLM $0.1756 -1.25%
ZEC $837.99 -1.55%
first_img

Google 稱 AI 伺服器記憶體成本破 75%,推軟硬體雙軌策略

2026-09-02 10:17:35

ChainCatcher 消息,SEMICON Taiwan 2026 記憶體高峰論壇 1 日登場,Alphabet 旗下 Google Cloud 供應鏈基礎架構資深總監 Nikhil Cherian 指出,隨著多模態與混合專家架構普及,AI 計算已從算力受限轉向記憶體受限,高效能記憶體已占 AI 伺服器硬體物料清單成本 75% 以上。面對容量、頻寬與功耗瓶頸,Google 透過推論與訓練硬體分流、無損量化軟體演算法等軟硬體雙軌策略,突破 AI 記憶體瓶頸。

Google 在硬體架構上採取分流策略,推出針對低延遲推論的 TPU 8i 以及專攻超大規模訓練的 TPU 8t。TPU 8i 配備 288 GB 高頻寬記憶體,晶片上 SRAM 容量擴增 3 倍至 384 MiB,將動態對話狀態與鍵值快取置於晶片內部,實現零晶片外延遲。TPU 8t 透過 9600 顆晶片組成超大型運算叢集,HBM 共享池化達到 2 PB 規模,消除晶片外數據傳輸瓶頸,搭配 TPU Direct Storage 技術。

Google 開發出免訓練的 TurboQuant 無損量化演算法,將大模型的鍵值快取從 32 位元壓縮至 3 位元,精確度零損失前提下縮小 6 倍記憶體佔用,帶來 8 倍注意力運算加速,導入舊世代 DRAM 整合技術延長零組件生命周期。

app_icon
ChainCatcher 與創新者共建Web3世界