구글은 AI 서버 메모리 비용이 75%를 초과했다고 발표하며 소프트웨어와 하드웨어의 이중 전략을 추진하고 있다
SEMICON Taiwan 2026 메모리 고峰 포럼이 1일 개최되었으며, Alphabet 산하 Google Cloud 공급망 인프라 수석 이사 Nikhil Cherian은 다중 모드 및 혼합 전문가 아키텍처의 보급에 따라 AI 연산이 계산 능력 제한에서 메모리 제한으로 전환되었으며, 고성능 메모리가 AI 서버 하드웨어 자재 목록 비용의 75% 이상을 차지한다고 지적했습니다. 용량, 대역폭 및 전력 소비 병목 현상에 직면하여 Google은 추론 및 훈련 하드웨어 분산, 무손실 양자화 소프트웨어 알고리즘 등의 소프트웨어 및 하드웨어 이중 경로 전략을 통해 AI 메모리 병목 현상을 극복하고 있습니다.
Google은 하드웨어 아키텍처에서 분산 전략을 채택하여 저지연 추론을 위한 TPU 8i와 초대규모 훈련을 전문으로 하는 TPU 8t를 출시했습니다. TPU 8i는 288 GB 고주파 대역폭 메모리를 장착하고 있으며, 칩의 SRAM 용량을 3배 확대하여 384 MiB로 증가시켰고, 동적 대화 상태 및 키 값 캐시를 칩 내부에 배치하여 제로 칩 외 지연을 실현했습니다. TPU 8t는 9600개의 칩으로 구성된 초대형 연산 클러스터를 통해 HBM 공유 풀링이 2 PB 규모에 도달하여 칩 외 데이터 전송 병목 현상을 제거하고 TPU Direct Storage 기술과 결합했습니다.
Google은 훈련이 필요 없는 TurboQuant 무손실 양자화 알고리즘을 개발하여 대모델의 키 값 캐시를 32비트에서 3비트로 압축하고, 정확도 손실 없이 6배 메모리 사용량을 줄이며, 8배 주의 연산 가속을 가져오고, 구세대 DRAM 통합 기술을 도입하여 부품 수명을 연장했습니다.






