Мы всю статью говорим о гигабайтах, но HBM — это не просто «много памяти». Это другая физическая архитектура, и она важна именно для LLM.
Представьте стандартную видеокарту на GDDR6X. Память расположена на отдельных чипах вокруг GPU, соединена с ним относительно узкой шиной. A100 на GDDR6 дала бы вам, условно, 672 ГБ/с пропускной способности. Неплохо для игр.
Но A100 на HBM2e даёт 2 000 ГБ/с. Почти в три раза больше. Потому что HBM — это стопка тонких чипов памяти, которые буквально уложены стопкой прямо рядом с GPU (или сверху него, через TSV — сквозные кремниевые переходы). Шина между ними огромная по ширине и очень короткая.
Почему это критично именно для LLM? Потому что трансформеры при инференсе — это задача, ограниченная пропускной способностью памяти, а не вычислительной мощностью. Упрощённо: GPU успевает посчитать раньше, чем успевает прочитать следующий кусок весов из памяти. Чем шире канал памяти — тем быстрее модель генерирует токены. Вот почему H100 на HBM3 (3,35 ТБ/с) генерирует текст заметно быстрее, чем математически сравнимая по FLOPS карта с GDDR6.
Характеристики GPU по памяти и пропускной способности:- H200 SXM — тип памяти HBM3e, объём 141 ГБ, пропускная способность 4,8 ТБ/с.
- H100 SXM — тип памяти HBM3, объём 80 ГБ, пропускная способность 3,35 ТБ/с.
- A100 SXM — тип памяти HBM2e, объём 80 ГБ, пропускная способность 2,0 ТБ/с.
- A100 PCIe — тип памяти HBM2e, объём 40/80 ГБ, пропускная способность 1,6 ТБ/с.
- RTX 4090 — тип памяти GDDR6X, объём 24 ГБ, пропускная способность 1,0 ТБ/с.