Комментарий Bernstein о семи типах памяти: после HBM, DRAM и NAND борются за следующий триллионный рынок

By: www.theblockbeats.info|2026/08/31 07:21:44
0
Поделиться
copy
Оценить в GoogleОценить в Google

TL;DR · Потребности AI в памяти не ограничиваются только HBM. Обучение требует задействовать полную память, начиная от HBM, системного DRAM до SSD и совместного хранения. · Настоящее узкое место в выводах возникает на этапе декодирования. KV Cache будет расти вместе с длиной контекста и количеством параллельных пользователей, и объем памяти может ограничить коммерческий масштаб раньше, чем веса модели. · Агент еще больше увеличивает нагрузку на память. Многоступенчатые вызовы создают контекст, вызывают внешние инструменты и увеличивают потребности в CPU, DRAM и KV Cache. · Между HBM и традиционными SSD появляются новые уровни, включая CXL, «Storage Next» и CMX, цель которых — обеспечить более низкие затраты на обработку постоянно растущих данных вывода. · Не все новые технологические пути могут быть реализованы. HBF, zHBM, NVHBM, ZAM и PIM сталкиваются с проблемами тепловыделения, выходом на уровень качества, совместимостью экосистемы или перераспределением интересов в цепочке поставок. · Bernstein продолжает положительно оценивать Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate и Western Digital, сохраняя «поддерживающую» оценку для Kioxia.


За последние два года рыночная нарратив о памяти для AI в основном сосредоточен на HBM. Однако с переходом больших моделей от обучения к масштабным выводам простое увеличение HBM уже не может решить все проблемы.


В своем последнем глобальном отчете о памяти Bernstein указывает, что различные рабочие нагрузки AI имеют явно различающиеся требования к памяти: обучение акцентирует внимание на вычислительной мощности и пропускной способности, в то время как на этапе декодирования вывода больше зависит от объема, RAG требует больших баз данных, а рабочие процессы агента одновременно увеличивают нагрузку как на традиционные серверы, так и на AI-серверы.


Это означает, что изменения, вызванные AI, передаются от HBM к системному DRAM, SSD, HDD и даже лентам. Вокруг «стены памяти» цепочка поставок начинает вставлять новые продукты между существующими уровнями, надеясь найти новый баланс между производительностью, объемом и стоимостью.


Пределы масштаба вывода могут зависеть от KV Cache


На этапе обучения больших моделей GPU и HBM по-прежнему занимают центральное место.


Обучение требует частого чтения параметров модели и промежуточных данных, предъявляя высокие требования к вычислительной мощности и пропускной способности памяти. Однако обучение крупной модели не зависит только от HBM: исходные наборы данных должны храниться на более дешевых носителях; перед тем как данные поступят в GPU, их обычно необходимо кэшировать и предварительно обрабатывать с помощью системного DRAM и локального SSD; длительное обучение, продолжающееся неделями или месяцами, также требует регулярного сохранения контрольных точек, чтобы избежать повторного начала задачи из-за аппаратных или программных сбоев.


Таким образом, одно крупное обучение фактически задействует полную систему памяти от HBM, системного DRAM до локального SSD и сетевого хранения.


На этапе вывода потребности в памяти еще больше дифференцируются.


Вывод обычно можно разбить на два этапа: предварительное заполнение (Prefill) и декодирование (Decode). Предварительное заполнение отвечает за обработку пользовательского ввода и генерацию первого токена, в основном выполняя крупные матричные вычисления, что больше зависит от «вычислительных ограничений». На этом этапе важнее всего использование GPU и пропускная способность HBM, часто используемым показателем является задержка первого токена.


Этап декодирования отличается. Модель должна поочередно генерировать токены и при создании нового токена использовать ранее полученную информацию. Чтобы избежать повторных вычислений, система обычно сохраняет эти данные в KV Cache.


KV Cache имеет две важные характеристики: его объем линейно увеличивается с длиной контекста, и каждый пользователь требует отдельного кэширования. Таким образом, когда длина контекста увеличивается и количество параллельных пользователей растет, оба этих фактора будут совместно увеличивать использование памяти.


Bernstein считает, что в развертывании AI на большом масштабе использование памяти KV Cache может превысить веса модели, став основным фактором, ограничивающим количество параллельных пользователей и окно контекста. Сколько пользователей модель может обслуживать и как долго она может поддерживать контекст, в конечном итоге будет напрямую влиять на объем доходов.


Таким образом, в эпоху вывода конкуренция сосредоточена не только на том, сколько вычислений может выполнить чип, но и на том, насколько низкие затраты система может сохранить и считывать постоянно растущий контекст.


RAG и агент, подталкивающие потребности к традиционной памяти


Распространение RAG и агента еще больше расширяет потребности в памяти AI за пределами HBM.


RAG в основном включает два этапа: создание базы данных и поиск в базе данных. При создании базы данных система должна обрабатывать большое количество неструктурированных данных, таких как PDF, веб-страницы, код и затем преобразовывать их в векторные и индексируемые форматы. Этот процесс больше зависит от больших SSD и системного DRAM, роль HBM относительно ограничена.


После создания базы данных запросы пользователей сначала преобразуются в векторы, а затем сопоставляются с содержимым базы данных. Генерация векторов может быть быстро выполнена на GPU и HBM, но настоящий поиск обычно больше зависит от системного DRAM. Результаты поиска затем объединяются с вопросами пользователей и проходят через обычный процесс предварительного заполнения и декодирования.


Рабочий процесс агента создает еще большую нагрузку.


Традиционный диалог обычно представляет собой однократный вызов «ввод---модель---вывод», тогда как агент должен разбить цель на несколько этапов, вызывать другие модели или внешние инструменты, сохранять промежуточные результаты и пересматривать план в зависимости от обратной связи. Результаты каждого вызова могут стать входными данными для следующего вызова модели.


Это одновременно увеличивает два типа потребностей: с одной стороны, вызовы инструментов и не-AI задачи требуют больше CPU и системной памяти; с другой стороны, постоянная передача контекста между несколькими моделями быстро увеличивает нагрузку на предварительное заполнение, декодирование и KV Cache.


Таким образом, развитие приложений агента не только благоприятно для GPU и HBM, но также может повысить спрос на серверный DRAM, корпоративные SSD и более дешевые носители хранения.


Между HBM и SSD возникают новые уровни памяти


Систему памяти традиционных серверов можно условно разделить на кэш внутри процессора, системный DRAM, локальный SSD и совместное хранилище. AI-серверы добавляют HBM в эту структуру, но объем HBM ограничен, а стоимость высока, что затрудняет обработку всех данных.


Текущий подход цепочки поставок заключается в добавлении новых продуктов между различными уровнями.


CXL пытается объединить физически разрозненную память в общий ресурсный пул, позволяя CPU, GPU и расширяемым устройствам более гибко использовать DRAM. Некоторые продукты также используют DRAM или SRAM в качестве кэша в сочетании с NAND, что позволяет снизить затраты и сократить задержку доступа.


Инициатива «Storage Next», поддерживаемая NVIDIA, пытается перенести часть управления хранилищем с CPU на GPU и обеспечить NAND более близкие к DRAM задержки, IOPS и гранулярность доступа к данным. Серия SSD GP, выпущенная Kioxia на основе XL-FLASH, является представителем этого направления.


CMX в основном ориентирован на KV Cache. Он размещает SSD в независимых узлах данных, соединяя их с вычислительными узлами через DPU, Ethernet и коммутатор. Его цель — делиться контекстом вывода между различными GPU, снижая дублирование хранения и преодолевая ограничения по объему памяти одного сервера.


Эти решения указывают на одну и ту же тенденцию: AI-системы не могут долго хранить все активные данные в HBM, и необходимо распределять их по различным уровням в зависимости от частоты доступа к данным и требований к задержке.


Горячие данные остаются в HBM, часть контекста перемещается в системный DRAM или высокопроизводительные SSD, а более холодные данные продолжают опускаться до обычных SSD, HDD или даже лент. Чем более детализированы уровни памяти, тем больше вероятность, что система сможет достичь баланса между производительностью и стоимостью.


Цена --

--
--
--

Новые технологии активно появляются, но коммерциализация все еще остается неопределенной


Вокруг «стены памяти» цепочка поставок уже предложила несколько новых путей.


План Samsung по zHBM предполагает укладку HBM над процессором, что еще больше сокращает расстояние передачи данных. Однако этот дизайн требует решения проблем с тепловыделением, возникающим от GPU, и предъявляет более высокие требования к выходу на уровень качества и стоимости для смешанной упаковки на уровне кристаллов.


NVHBM, поддерживаемый NVIDIA, предполагает, что базовые голые чипы будут разрабатываться NVIDIA и, возможно, производиться TSMC. Этот подход может снизить потребление энергии и повысить пропускную способность, но также может ослабить ценность проектирования и производства голых чипов HBM для производителей памяти. С стандартизацией продуктов часть добавленной стоимости может быть перенесена от производителей памяти к NVIDIA и фабрикам по производству кристаллов.


HBF, поддерживаемый SanDisk и SK Hynix, стремится использовать NAND для обеспечения пропускной способности, близкой к HBM, одновременно получая больший объем и более низкие единичные затраты. Однако между NAND и DRAM по-прежнему существует значительная разница в задержке и производительности, и HBF необходимо преодолеть несколько технологических уровней, что делает реализацию непростой задачей.


ZAM от Intel пытается повернуть голые чипы DRAM на 90 градусов, чтобы улучшить тепловыделение, с целью достижения практического применения в 2029 финансовом году; HBC от Qualcomm использует LPDDR и традиционную упаковку, жертвуя частью производительности, чтобы обойти затраты CoWoS.


Кроме того, PIM пытается напрямую добавить вычислительные возможности в чипы памяти, чтобы уменьшить перемещение данных между процессором и памятью. Однако это изменит существующую вычислительную архитектуру, требуя совместной адаптации процессоров, программного обеспечения и сетей, и также повлияет на уже высокоразвиты системы разделения логических и памятьных чипов. Bernstein считает, что его внедрение в отрасли все еще ограничено.


Таким образом, быстрое увеличение числа новых решений не означает, что все пути смогут сформировать масштабируемый рынок. Способность совместить с существующей экосистемой программного и аппаратного обеспечения, наличие конкурентных преимуществ по стоимости и возможность достижения баланса интересов всех сторон в цепочке поставок определят окончательный результат коммерциализации.


Пользователи AI-памяти не ограничиваются только производителями HBM


С точки зрения инвестиций, оценка Bernstein довольно ясна: влияние AI на индустрию хранения распространяется от небольшого числа высококачественных продуктов к большему количеству уровней.


HBM по-прежнему остается основным элементом для обучения и высокопроизводительных выводов, Samsung Electronics, SK Hynix и Micron продолжат получать выгоду от спроса на высокоскоростную память. Однако с увеличением масштаба вывода важность системного DRAM и NAND возрастет. Переполнение KV Cache, базы данных RAG и большое количество промежуточных данных, создаваемых агентом, также увеличат спрос на SSD и совместное хранение.


Более холодные данные также продолжат опускаться. Bernstein утверждает, что рост данных, вызванный AI, уже начал приносить пользу HDD; в некоторых сценариях, из-за недостатка емкости NAND и HDD, также увеличивается спрос на ленты, которые традиционно использовались в основном для архивирования.


Отчет продолжает давать Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate и Western Digital оценку «выше рынка». При этом Samsung Electronics, SK Hynix и Micron относятся к DRAM и HBM, SanDisk выигрывает от NAND и HBF, а Seagate и Western Digital соответствуют более дешевым решениям для хранения большого объема. Kioxia оценена как «ниже рынка».


Тем не менее, основная ценность этого отчета не в том, чтобы перечислить ряд новых технологических аббревиатур, а в том, чтобы переопределить границы рынка AI-памяти.


Узкие места эпохи обучения в основном сосредоточены на GPU и HBM; в эпоху вывода и агентов узкие места начинают распространяться по всей системе памяти. В будущем конкуренция в области инфраструктуры AI будет зависеть не только от того, насколько быстро чипы могут выполнять вычисления, но и от того, насколько эффективно данные могут перемещаться между HBM, DRAM, NAND и совместным хранением при достаточно низких затратах.

Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.

Вам также может понравиться

36-дневная задержка стейкинга стоит депозиторам Ethereum более 350 000 долларов в день

Более 2 миллионов Ethereum ожидают активации в блокчейне, поскольку стейкнутое предложение превышает 42 миллиона ETH.

Искусственный интеллект создает бесконечность, BTC создает дефицит: настоящие изменения Web3 касаются не производственных отношений, а отношений ценности

Кто продает Yushu? Масштабный перевод высокоуровневых акций, 228,7 миллиона акций будет разблокировано в следующем году

Компания Ripple пожертвовала 300 тысяч долларов на помощь пострадавшим от наводнений в Непале и Тибете

Арбитраж криптовалют и ценовые сканеры: как квантовые трейдеры находят неэффективность в ставках и спредах с помощью торговых API

Сканер арбитража криптовалют сравнивает цены, ставки финансирования, базис и ликвидность с помощью торговых API, выявляя неэффективности с учетом комиссий и рисков.

Дефицит DRAM до 2030 года: как позиционировать себя на рынке гигантов памяти?

...

Свежие листинги на WEEX

iconiconiconiconiconiconiconiconicon
Служба поддержки:@weikecs
Деловое сотрудничество:@weikecs
Количественная торговля и ММ:bd@weex.com
VIP-программа:support@weex.com