BTC $79,159.10 -0.75%
ETH $2,489.55 +0.01%
BNB $744.52 -0.48%
XRP $1.40 -1.23%
SOL $104.52 -1.92%
TRX $0.3351 +0.07%
DOGE $0.0903 +1.05%
ADA $0.2207 +1.19%
BCH $260.06 +0.74%
LINK $13.01 +5.62%
HYPE $87.28 -2.14%
AAVE $132.72 -1.44%
SUI $0.8254 +3.13%
XLM $0.1917 +3.46%
ZEC $1,173.39 -0.48%
BTC $79,159.10 -0.75%
ETH $2,489.55 +0.01%
BNB $744.52 -0.48%
XRP $1.40 -1.23%
SOL $104.52 -1.92%
TRX $0.3351 +0.07%
DOGE $0.0903 +1.05%
ADA $0.2207 +1.19%
BCH $260.06 +0.74%
LINK $13.01 +5.62%
HYPE $87.28 -2.14%
AAVE $132.72 -1.44%
SUI $0.8254 +3.13%
XLM $0.1917 +3.46%
ZEC $1,173.39 -0.48%
first_img

Google заявила, что стоимость памяти для серверов AI упала на 75%, и предложила стратегию двойного подхода к программному и аппаратному обеспечению

2026-09-02 10:17:35

Сообщение ChainCatcher, форум по памяти SEMICON Taiwan 2026 пройдет 1 числа. Старший директор по инфраструктуре цепочки поставок Google Cloud, входящей в Alphabet, Нихил Чериан отметил, что с распространением многомодальных и смешанных экспертных архитектур вычисления ИИ перешли от ограничений по вычислительной мощности к ограничениям по памяти, высокопроизводительная память уже составляет более 75% стоимости аппаратного обеспечения AI-серверов. Столкнувшись с ограничениями по емкости, пропускной способности и потреблению энергии, Google преодолевает узкие места в памяти AI с помощью стратегии двойного трека программного и аппаратного обеспечения, включая распределение нагрузки для вывода и обучения, а также алгоритмы без потерь.

Google применяет стратегию распределения нагрузки в аппаратной архитектуре, выпуская TPU 8i для вывода с низкой задержкой и TPU 8t, специализированный для сверхмасштабного обучения. TPU 8i оснащен 288 ГБ высокочастотной памяти, объем SRAM на чипе увеличен в 3 раза до 384 MiB, что позволяет разместить динамическое состояние диалога и кэш ключей внутри чипа, достигая нулевой задержки вне чипа. TPU 8t формируется из 9600 чипов, образующих сверхбольшой вычислительный кластер, HBM с совместным пулом достигает 2 PB, устраняя узкие места передачи данных вне чипа, в сочетании с технологией TPU Direct Storage.

Google разработал алгоритм без потерь TurboQuant, который позволяет сжать кэш ключей больших моделей с 32 бит до 3 бит, уменьшая использование памяти в 6 раз без потери точности, что обеспечивает ускорение вычислений внимания в 8 раз, внедряя технологии интеграции старого поколения DRAM для продления жизненного цикла компонентов.

app_icon
ChainCatcher Building the Web3 world with innovations.