Разбираемся в физике и экономике High Bandwidth Memory: почему HBM определяет производительность AI-систем, как устроено производство и почему дефицит HBM стал структурной проблемой всей отрасли искусственного интеллекта.

почему HBM стала дефицитным ресурсом для AI-инфраструктуры

Собственное представительство в Китае
Оперативная доставка в любой регион России
Инженерная экспертиза
Прямые поставки из Китая

Что такое HBM и почему именно она стала дефицитным ресурсом для AI-инфраструктуры

Если вы занимаетесь планированием вычислительной инфраструктуры для задач машинного обучения, то рано или поздно сталкиваетесь с одним и тем же ответом от поставщиков: «H100 сейчас нет в наличии, сроки поставки — от шести месяцев». И дело не в том, что NVIDIA не справляется с производством GPU. Дело в том, что GPU без HBM — это корпус без мозга. Именно нехватка High Bandwidth Memory сдерживает всю цепочку поставок AI-оборудования, и именно поэтому стоит разобраться, что это за компонент и почему его так сложно производить в нужных объёмах.

Физика вопроса: почему обычная память перестала справляться

Чтобы понять, зачем вообще понадобилась HBM, нужно вернуться к базовой проблеме. Современный GPU — это огромная вычислительная машина. H100 выполняет около 2000 триллионов операций с плавающей точкой в секунду. Но что толку от этой вычислительной мощности, если данные не успевают поступать к вычислительным ядрам?

Представьте конвейер на производстве. Вы можете поставить сколько угодно рабочих рук на финальную сборку, но если подача комплектующих идёт по одной узкой трубе, все эти руки будут простаивать. Именно так выглядит ситуация, когда мощный GPU подключён к медленной памяти: вычислительные ядра ждут данных, а пропускная способность памяти становится тем самым узким горлышком, которое определяет реальную производительность системы.

Традиционная память GDDR6X, которую ставят на игровые видеокарты, даёт пропускную способность около 1 ТБ/с. Это достигается за счёт широкой шины данных и высоких тактовых частот. Но для AI-нагрузок этого категорически недостаточно. Трансформерные модели при инференсе тратят большую часть времени именно на чтение весов из памяти, а не на сами вычисления. Это принципиально другой паттерн нагрузки по сравнению с играми или рендерингом.

Как устроена HBM: стопка чипов как архитектурное решение

HBM решает проблему пропускной способности нестандартным способом. Вместо того чтобы гнаться за тактовыми частотами (что порождает тепло и энергопотребление), инженеры пошли в другую сторону — они сделали шину данных чрезвычайно широкой.

Обычная видеопамять подключается к GPU через шину шириной 256–384 бит. HBM использует шину шириной 1024 бита на один стек памяти, а таких стеков в одной карте может быть несколько. H100 SXM имеет пять стеков HBM3 с суммарной шиной 5120 бит. Именно это даёт 3,35 ТБ/с пропускной способности — в три с лишним раза больше, чем самая быстрая GDDR6X.

Физически HBM — это стопка тонких кремниевых чипов памяти (DRAM), соединённых между собой вертикальными соединениями через кремний (TSV, Through-Silicon Vias). Эта стопка устанавливается рядом с GPU-чипом на специальной подложке-интерпозере, которая соединяет их короткими широкими дорожками. Расстояние между памятью и вычислительным ядром — несколько миллиметров, тогда как у традиционной GDDR память разнесена по периметру платы на десятки сантиметров. Это кардинально снижает задержки и позволяет использовать гораздо более широкую шину без катастрофического роста энергопотребления.

Каждое новое поколение HBM добавляет ёмкость и пропускную способность: HBM2e (A100) — 2 ТБ/с, HBM3 (H100) — 3,35 ТБ/с, HBM3e (H200) — 4,8 ТБ/с при 141 ГБ на карту. Рост идёт не только за счёт новых стеков, но и за счёт увеличения числа слоёв в каждом стеке.

Почему производить HBM сложнее, чем обычную память

Вот здесь начинается то, что объясняет нынешний дефицит. Производство HBM — это принципиально другой технологический процесс по сравнению с выпуском обычных DRAM-чипов.

Начнём с TSV. Сделать сквозное отверстие в кремниевом чипе толщиной несколько десятков микрон, заполнить его металлом и обеспечить надёжный электрический контакт на всех уровнях стопки — это операция ювелирной точности. Процент брака при производстве TSV значительно выше, чем при обычном планарном производстве микросхем. Один дефектный TSV в стеке из восьми-двенадцати слоёв ведёт к браку всего стека.

Дальше — бондинг. Стопку чипов нужно скрепить между собой так, чтобы все тысячи TSV совпали с точностью до единиц нанометров. Это требует специализированного оборудования и специфического технологического процесса, которым владеют буквально несколько компаний в мире.

Наконец — интерпозер. Подложка, на которой устанавливаются GPU и стеки HBM, сама по себе является сложным изделием. Кремниевый интерпозер NVIDIA CoWoS (Chip-on-Wafer-on-Substrate) производится на мощностях TSMC и является отдельным узким местом в производственной цепочке. Площадь интерпозера для H100 составляет около 800 мм² — это один из крупнейших кремниевых компонентов в серийном производстве.

В результате производственная цепочка H100 зависит одновременно от SK Hynix или Micron (производство HBM3), от TSMC (производство GPU-чипа и интерпозера), от OSAT-партнёров (финальная сборка и бондинг). Узкое место в любом звене останавливает всю цепочку.

Структурный дефицит: почему это не временная проблема

Дефицит HBM нельзя решить просто построив новый завод. Это долгосрочное структурное ограничение по нескольким причинам.

Во-первых, производственные мощности по выпуску HBM создавались под умеренный спрос. Ещё в 2021 году HBM использовалась преимущественно в суперкомпьютерных нишевых применениях и некоторых серверных GPU. Взрывной рост спроса на AI-ускорители начался в 2023 году и застал производителей без запаса мощностей. Строительство нового завода по производству полупроводников занимает три-пять лет и стоит десятки миллиардов долларов.

Во-вторых, мощности TSMC по производству CoWoS-интерпозеров ограничены. TSMC несколько лет наращивает эти мощности, но спрос всё равно опережает предложение. Все крупные потребители — NVIDIA, AMD, Google (TPU), Amazon (Trainium) — конкурируют за одни и те же производственные линии.

В-третьих, каждое новое поколение HBM требует нового оборудования и новых техпроцессов. Переход с HBM3 на HBM3e — это не просто штамповка тех же чипов быстрее. Это новые технологические операции, новый период отладки производства, новый рост брака на начальном этапе. SK Hynix, Samsung и Micron инвестируют в расширение, но темп роста предложения объективно ниже темпа роста спроса.

Практическое следствие для тех, кто планирует AI-инфраструктуру: горизонт планирования должен быть не «куплю когда понадоблюсь», а «резервирую сейчас под проект через полгода». Именно так работают крупные игроки — гиперскейлеры бронируют производственные мощности на год вперёд и заключают долгосрочные контракты с производителями.

Что это означает при выборе инфраструктуры

Для инженера или руководителя, принимающего решение о закупке AI-серверов, понимание природы HBM-дефицита меняет несколько практических вещей.

Первое: объём HBM — это не просто характеристика памяти, это верхний предел модели, которую вы сможете запустить. H100 с 80 ГБ HBM3 и H200 с 141 ГБ HBM3e — это не просто «больше памяти», это принципиально разный класс задач. H200 позволяет запускать модели класса 70B в BF16 на одной карте там, где H100 требует две. Это напрямую влияет на топологию кластера и на стоимость инфраструктуры.

Второе: пропускная способность HBM определяет скорость инференса не хуже, чем количество FLOPS. Для задач, где важен latency (время ответа пользователю), H200 с 4,8 ТБ/с будет существенно быстрее H100 с 3,35 ТБ/с даже при одинаковом объёме памяти — просто потому что быстрее читает веса модели.

Третье: альтернативы существуют. AMD MI300X с 192 ГБ HBM3 на один ускоритель — это реальная конкурентная альтернатива H100 для инференс-задач с большими моделями. Цепочки поставок AMD частично отличаются от NVIDIA, что означает другую доступность на рынке.

Если вам нужна инфраструктура для AI-задач в обозримой перспективе — работайте с поставщиками, которые имеют реальные договорённости с цепочками поставок, а не просто пересылают запросы дистрибьюторам. Команда «Лямбда-Т» занимается поставками GPU-кластеров и AI-серверов, понимает реальные сроки и доступность оборудования на рынке, и поможет подобрать конфигурацию с учётом того, что можно получить в вашем горизонте планирования, а не только того, что красиво выглядит в спецификации.

Оставьте заявку на ltrade.su — получите честную картину по доступности оборудования и конфигурацию, которая реально решает вашу задачу в ваши сроки.

Если у вас есть опыт работы с HBM-системами в продакшене — делитесь в комментариях. Какие узкие места по памяти вы обнаружили на практике и как их решали? Практический опыт здесь ценнее любых бенчмарков.
Имя
Телефон
E-mail
Сообщение
[ оставьте заявку ]

получите точный расчёт под вашу задачу?. Оставьте ваши данные и мы свяжемся с вами

Нажимая, на кнопку «Обсудить» я подтверждаю ознакомление и даю Согласие на обработку моих персональных данных в порядке и на условиях, указанных в Политике обработки персональных данных