К содержанию

RAM начинает считать сама: как Samsung LPDDR5X-PIM переносит AI-вычисления прямо в память

Samsung показала память с локальной PIM-логикой: до 614 GB/s внутренней полосы и 3,01× tokens/s в предварительном тесте Llama 3.1 8B.

В AI всё дороже не сама арифметика, а перемещение данных. LPDDR5X-PIM меняет старое правило и выполняет часть математики прямо рядом с банками DRAM.
5 хв читання
RAM начинает считать сама: как Samsung LPDDR5X-PIM переносит AI-вычисления прямо в память

Десятилетиями компьютер устроен примерно одинаково: процессор считает, память хранит, а данные постоянно перемещаются между ними. Для обычных программ эта схема работает отлично, но в эпоху AI всё чаще ограничением становится не скорость арифметики, а скорость доставки весов и активаций к вычислительным блокам. На Hot Chips 2026 Samsung подробно показала LPDDR5X-PIM — память, в которой часть простых вычислений выполняется прямо рядом с банками DRAM. Это не «CPU внутри оперативки» в бытовом смысле, но уже вполне реальный шаг к системе, где память перестаёт быть пассивным складом.

В показанной конфигурации обычная LPDDR5X-9600 имеет около 76,8 GB/s внешней пиковой пропускной способности. Суммарная локальная полоса PIM-логики внутри банков достигает примерно 614 GB/s — в восемь раз больше. В предварительном тесте Llama 3.1 8B Samsung заявляет 2,28× улучшение runtime и до 3,01× больше tokens per second. Но важнее самой цифры то, что часть работы теперь происходит там, где уже находятся данные.

AI всё чаще упирается в перемещение данных

Современные GPU и NPU умеют выполнять огромное количество multiply-accumulate операций. Проблема в том, что каждой операции нужны данные. Если вычислительные блоки ждут очередную порцию весов из памяти, добавление новых ядер не всегда ускоряет систему.

Эту проблему называют memory wall. Кэши, более широкие шины, HBM и advanced packaging пытаются сократить расстояние между логикой и данными. HBM делает это чрезвычайно эффективно, но она дорога, требует сложной упаковки и имеет свои тепловые ограничения. LPDDR, наоборот, изначально оптимизирована под массовость и низкое энергопотребление.

Processing-in-Memory предлагает радикально простую идею: если над большим массивом в DRAM всё равно нужно выполнить однотипную математику, не обязательно сначала вывозить весь массив в процессор. Часть операций можно провести рядом с ячейками памяти, а наружу вернуть уже сокращённый результат.

Как устроена LPDDR5X-PIM Samsung

В новой реализации каждый банк получает собственный PIM-блок с регистрами и параллельными MAC-деревьями. Память может работать либо как обычная DRAM в single-bank mode, либо включать multi-bank PIM mode для параллельных операций.

Samsung старается сохранить знакомую экосистему. Демонстрационный модуль использует стандартоподобный 561-ball package, два 64-битных rank и 16 GB ёмкости. Поддерживаются FP16, FP8 и integer-операции разной разрядности. Это сразу показывает назначение: не универсальная замена CPU, а ускорение повторяющейся векторной и матричной математики.

614 GB/s — это не новая внешняя шина

Цифру легко прочитать неправильно. Samsung не превратила интерфейс LPDDR5X в внешнюю шину на 614 GB/s. Речь о суммарной локальной пропускной способности, доступной PIM внутри банков. В этом и смысл: данные не должны проходить через более узкий внешний интерфейс, если операция выполняется в самой памяти.

Для inference это особенно интересно, потому что модель снова и снова читает огромные массивы весов. Data movement становится заметной частью задержки и энергопотребления. Сокращая ненужные read/write между DRAM и accelerator, можно выигрывать не только секунды, но и джоули.

Что показал тест Llama 3.1 8B

Samsung использовала edge AI accelerator и Llama 3.1 8B. В предварительных данных runtime улучшился в 2,28 раза, а throughput достиг до 3,01× относительно обычной LPDDR5X. Это собственный benchmark производителя, а не независимая лаборатория.

И есть важная оговорка: результат модели на демонстрационном слайде отличался от baseline. На вопрос аудитории Samsung ответила, что работа над точностью продолжается. Поэтому нельзя упрощать вывод до «тот же результат втрое быстрее». Сначала нужно увидеть независимые тесты, сравнение perplexity/accuracy и разные модели.

Для новой архитектуры это ожидаемо. Перенос вычислений ближе к памяти затрагивает precision, порядок операций, компилятор и kernels. Успех будет определяться не одним пиковым числом, а тем, сохраняется ли ускорение при требуемом качестве.

Почему не поставить HBM везде

HBM остаётся идеальной для топовых GPU: она даёт терабайты в секунду и находится рядом с compute die. Но HBM дорога, зависит от ограниченных мощностей advanced packaging и сама стала дефицитным ресурсом AI-индустрии.

LPDDR5X-PIM не должна победить HBM по абсолютной полосе. Её ниша — edge AI, клиентские устройства, компактные inference-системы и серверы, где важны цена и энергопотребление. Samsung прямо говорит о server, client и mobile как о целевых сегментах.

Граница между «мобильной» и «серверной» памятью уже размывается. Nvidia использует LPDDR5X в SOCAMM2-модулях для Vera CPU, Intel — в новых AI accelerator. Поэтому перенос PIM именно в LPDDR выглядит своевременно.

Энергия: вычислять внутри памяти тоже стоит денег

Дополнительная логика потребляет электричество. Samsung признаёт, что пиковая мощность в PIM-режиме может заметно вырасти. Расчёт другой: сокращение внешнего data movement должно экономить больше энергии, чем тратят локальные MAC-блоки.

Это нужно проверять в реальных устройствах. Для ноутбука важны не только средние ватты, но и локальный нагрев package, пики и throttling. Для сервера — поведение сотен модулей и охлаждение стойки. Красивое отношение performance/watt на одной операции ещё не гарантирует преимущества всей системы.

Почему PIM не стал массовым раньше

Processing-in-memory обсуждают десятилетиями. Samsung уже показывала HBM-PIM. Главная преграда — программное обеспечение. Обычная программа считает память пассивным массивом байтов. Для PIM нужен runtime, который понимает, какие операции переносить внутрь, как синхронизировать данные и как взаимодействовать с cache hierarchy.

Если каждую нейросеть придётся переписывать вручную под конкретный DRAM-чип, технология останется нишевой. Поэтому настоящий перелом наступит не после следующего benchmark, а когда появятся стандартизованные инструкции, compiler support и удобные API. Samsung уже говорит о будущем LPDDR6X-PIM и стандартизации.

Что это даст обычному AI-PC

Представим ноутбук, который локально запускает модель на 8–20 млрд параметров. NPU может быть достаточно быстрым, но unified memory ограничивает generation speed. Если часть matrix-vector операций переносится в LPDDR, производителю не нужно бесконечно расширять внешнюю шину или ставить дорогую специальную память.

Потенциальный результат — более быстрые локальные ассистенты при том же TDP. Но реальный выигрыш зависит от доли workload, которую можно эффективно offload. Если PIM ускоряет лишь небольшой участок графа, end-to-end прирост будет ниже рекламного числа.

Что стоит отслеживать дальше

В ближайшие поколения важны четыре вещи: появление серийных устройств, независимые измерения end-to-end inference, поддержка PIM в распространённых AI runtimes и стандартизация команд. Если LPDDR5X-PIM останется функцией одного закрытого SDK, её влияние будет ограниченным. Если же framework сможет автоматически размещать подходящие операции в памяти так же, как сегодня выбирает CPU, GPU или NPU, PIM станет намного более практичной.

Отдельный вопрос — цена. Дополнительная логика занимает площадь кристалла и усложняет validation. Производитель устройства будет сравнивать эту надбавку не с обычной LPDDR в вакууме, а с альтернативами: более широкой шиной, дополнительным кешем, более быстрым NPU или просто большей батареей. Поэтому коммерческий успех определит не рекордная пропускная способность, а стоимость полученного токена и ватта.

Память становится вычислительной частью системы

Главный смысл LPDDR5X-PIM шире одной микросхемы Samsung. Старое разделение «CPU/GPU считает — RAM хранит» становится слишком дорогим для AI. HBM, CXL, chiplets, compute-near-memory и PIM решают один фундаментальный вопрос: как перестать тратить огромное количество энергии на перевозку данных.

Samsung ещё должна доказать точность, эффективность и экономику новой памяти. Но сама логика выглядит неизбежной. Если перемещение бита начинает стоить больше, чем простая операция над ним, архитектуре выгоднее принести вычисление к данным, а не данные к вычислению.

Главное за минуту

Samsung переносит простые AI-операции к банкам DRAM, уменьшая дорогое перемещение данных между памятью и accelerator.

  • LPDDR5X-PIM добавляет локальные MAC-блоки к LPDDR5X.
  • Samsung показывает около 614 GB/s локальной полосы против 76,8 GB/s LPDDR5X-9600.
  • До 3,01× tokens/s заявлено в preliminary Llama 3.1 8B test, но output отличался от baseline.
  • Целевые сегменты — server, client и mobile/edge AI.

Ключевые цифры

614 GB/s
локальная PIM-полоса

данные Samsung

76,8 GB/s
LPDDR5X-9600

внешняя peak bandwidth

3,01×
tokens/s

preliminary Llama 3.1 8B

16 GB
демо-конфигурация

два 64-bit ranks

Wafer как иллюстрация производства памяти и PIM-логики. Armin Kübelbeck / Wikimedia Commons, CC BY-SA 3.0.
DRAM-чип как иллюстрация классической оперативной памяти. Laserlicht / Wikimedia Commons, CC BY-SA 3.0.
FAQ

Вопросы и ответы

Заменит ли LPDDR5X-PIM HBM?
Нет. HBM остаётся намного быстрее для топовых GPU. PIM интересен там, где важны стоимость, энергия и edge inference.
Почему 614 GB/s — не внешняя шина?
Это суммарная локальная bandwidth внутри банков, доступная PIM-логике.
Когда появятся массовые устройства?
Технология уже показана как реальный product direction, но точные устройства и сроки массового запуска не объявлены.
Проверка фактов

Источники и проверка

  1. Samsung SemiconductorSamsung unveils next-gen memory vision at FMS 2026
    Первичный источникПроверено 2026-08-26Открыть источник ↗
  2. Tom's HardwareHot Chips 2026: Samsung makes LPDDR5X smart with logic unit in memory
    Вторичный источникПроверено 2026-08-26Открыть источник ↗
  3. Samsung SemiconductorLPDDR product overview
    Первичный источникПроверено 2026-08-26Открыть источник ↗
Далее на RankPoint

Читайте также

Комментарии0 комментариев

Комментарии

Пока комментариев нет.Обсуждение ведётся отдельно для каждой языковой версии материала.