В материале
12 разд.Десятилетиями компьютер устроен примерно одинаково: процессор считает, память хранит, а данные постоянно перемещаются между ними. Для обычных программ эта схема работает отлично, но в эпоху AI всё чаще ограничением становится не скорость арифметики, а скорость доставки весов и активаций к вычислительным блокам. На Hot Chips 2026 Samsung подробно показала LPDDR5X-PIM — память, в которой часть простых вычислений выполняется прямо рядом с банками DRAM. Это не «CPU внутри оперативки» в бытовом смысле, но уже вполне реальный шаг к системе, где память перестаёт быть пассивным складом.
В показанной конфигурации обычная LPDDR5X-9600 имеет около 76,8 GB/s внешней пиковой пропускной способности. Суммарная локальная полоса PIM-логики внутри банков достигает примерно 614 GB/s — в восемь раз больше. В предварительном тесте Llama 3.1 8B Samsung заявляет 2,28× улучшение runtime и до 3,01× больше tokens per second. Но важнее самой цифры то, что часть работы теперь происходит там, где уже находятся данные.
AI всё чаще упирается в перемещение данных
Современные GPU и NPU умеют выполнять огромное количество multiply-accumulate операций. Проблема в том, что каждой операции нужны данные. Если вычислительные блоки ждут очередную порцию весов из памяти, добавление новых ядер не всегда ускоряет систему.
Эту проблему называют memory wall. Кэши, более широкие шины, HBM и advanced packaging пытаются сократить расстояние между логикой и данными. HBM делает это чрезвычайно эффективно, но она дорога, требует сложной упаковки и имеет свои тепловые ограничения. LPDDR, наоборот, изначально оптимизирована под массовость и низкое энергопотребление.
Processing-in-Memory предлагает радикально простую идею: если над большим массивом в DRAM всё равно нужно выполнить однотипную математику, не обязательно сначала вывозить весь массив в процессор. Часть операций можно провести рядом с ячейками памяти, а наружу вернуть уже сокращённый результат.
Как устроена LPDDR5X-PIM Samsung
В новой реализации каждый банк получает собственный PIM-блок с регистрами и параллельными MAC-деревьями. Память может работать либо как обычная DRAM в single-bank mode, либо включать multi-bank PIM mode для параллельных операций.
Samsung старается сохранить знакомую экосистему. Демонстрационный модуль использует стандартоподобный 561-ball package, два 64-битных rank и 16 GB ёмкости. Поддерживаются FP16, FP8 и integer-операции разной разрядности. Это сразу показывает назначение: не универсальная замена CPU, а ускорение повторяющейся векторной и матричной математики.
614 GB/s — это не новая внешняя шина
Цифру легко прочитать неправильно. Samsung не превратила интерфейс LPDDR5X в внешнюю шину на 614 GB/s. Речь о суммарной локальной пропускной способности, доступной PIM внутри банков. В этом и смысл: данные не должны проходить через более узкий внешний интерфейс, если операция выполняется в самой памяти.
Для inference это особенно интересно, потому что модель снова и снова читает огромные массивы весов. Data movement становится заметной частью задержки и энергопотребления. Сокращая ненужные read/write между DRAM и accelerator, можно выигрывать не только секунды, но и джоули.
Что показал тест Llama 3.1 8B
Samsung использовала edge AI accelerator и Llama 3.1 8B. В предварительных данных runtime улучшился в 2,28 раза, а throughput достиг до 3,01× относительно обычной LPDDR5X. Это собственный benchmark производителя, а не независимая лаборатория.
И есть важная оговорка: результат модели на демонстрационном слайде отличался от baseline. На вопрос аудитории Samsung ответила, что работа над точностью продолжается. Поэтому нельзя упрощать вывод до «тот же результат втрое быстрее». Сначала нужно увидеть независимые тесты, сравнение perplexity/accuracy и разные модели.
Для новой архитектуры это ожидаемо. Перенос вычислений ближе к памяти затрагивает precision, порядок операций, компилятор и kernels. Успех будет определяться не одним пиковым числом, а тем, сохраняется ли ускорение при требуемом качестве.
Почему не поставить HBM везде
HBM остаётся идеальной для топовых GPU: она даёт терабайты в секунду и находится рядом с compute die. Но HBM дорога, зависит от ограниченных мощностей advanced packaging и сама стала дефицитным ресурсом AI-индустрии.
LPDDR5X-PIM не должна победить HBM по абсолютной полосе. Её ниша — edge AI, клиентские устройства, компактные inference-системы и серверы, где важны цена и энергопотребление. Samsung прямо говорит о server, client и mobile как о целевых сегментах.
Граница между «мобильной» и «серверной» памятью уже размывается. Nvidia использует LPDDR5X в SOCAMM2-модулях для Vera CPU, Intel — в новых AI accelerator. Поэтому перенос PIM именно в LPDDR выглядит своевременно.
Энергия: вычислять внутри памяти тоже стоит денег
Дополнительная логика потребляет электричество. Samsung признаёт, что пиковая мощность в PIM-режиме может заметно вырасти. Расчёт другой: сокращение внешнего data movement должно экономить больше энергии, чем тратят локальные MAC-блоки.
Это нужно проверять в реальных устройствах. Для ноутбука важны не только средние ватты, но и локальный нагрев package, пики и throttling. Для сервера — поведение сотен модулей и охлаждение стойки. Красивое отношение performance/watt на одной операции ещё не гарантирует преимущества всей системы.
Почему PIM не стал массовым раньше
Processing-in-memory обсуждают десятилетиями. Samsung уже показывала HBM-PIM. Главная преграда — программное обеспечение. Обычная программа считает память пассивным массивом байтов. Для PIM нужен runtime, который понимает, какие операции переносить внутрь, как синхронизировать данные и как взаимодействовать с cache hierarchy.
Если каждую нейросеть придётся переписывать вручную под конкретный DRAM-чип, технология останется нишевой. Поэтому настоящий перелом наступит не после следующего benchmark, а когда появятся стандартизованные инструкции, compiler support и удобные API. Samsung уже говорит о будущем LPDDR6X-PIM и стандартизации.
Что это даст обычному AI-PC
Представим ноутбук, который локально запускает модель на 8–20 млрд параметров. NPU может быть достаточно быстрым, но unified memory ограничивает generation speed. Если часть matrix-vector операций переносится в LPDDR, производителю не нужно бесконечно расширять внешнюю шину или ставить дорогую специальную память.
Потенциальный результат — более быстрые локальные ассистенты при том же TDP. Но реальный выигрыш зависит от доли workload, которую можно эффективно offload. Если PIM ускоряет лишь небольшой участок графа, end-to-end прирост будет ниже рекламного числа.
Что стоит отслеживать дальше
В ближайшие поколения важны четыре вещи: появление серийных устройств, независимые измерения end-to-end inference, поддержка PIM в распространённых AI runtimes и стандартизация команд. Если LPDDR5X-PIM останется функцией одного закрытого SDK, её влияние будет ограниченным. Если же framework сможет автоматически размещать подходящие операции в памяти так же, как сегодня выбирает CPU, GPU или NPU, PIM станет намного более практичной.
Отдельный вопрос — цена. Дополнительная логика занимает площадь кристалла и усложняет validation. Производитель устройства будет сравнивать эту надбавку не с обычной LPDDR в вакууме, а с альтернативами: более широкой шиной, дополнительным кешем, более быстрым NPU или просто большей батареей. Поэтому коммерческий успех определит не рекордная пропускная способность, а стоимость полученного токена и ватта.
Память становится вычислительной частью системы
Главный смысл LPDDR5X-PIM шире одной микросхемы Samsung. Старое разделение «CPU/GPU считает — RAM хранит» становится слишком дорогим для AI. HBM, CXL, chiplets, compute-near-memory и PIM решают один фундаментальный вопрос: как перестать тратить огромное количество энергии на перевозку данных.
Samsung ещё должна доказать точность, эффективность и экономику новой памяти. Но сама логика выглядит неизбежной. Если перемещение бита начинает стоить больше, чем простая операция над ним, архитектуре выгоднее принести вычисление к данным, а не данные к вычислению.
Samsung переносит простые AI-операции к банкам DRAM, уменьшая дорогое перемещение данных между памятью и accelerator.
- LPDDR5X-PIM добавляет локальные MAC-блоки к LPDDR5X.
- Samsung показывает около 614 GB/s локальной полосы против 76,8 GB/s LPDDR5X-9600.
- До 3,01× tokens/s заявлено в preliminary Llama 3.1 8B test, но output отличался от baseline.
- Целевые сегменты — server, client и mobile/edge AI.
Ключевые цифры
данные Samsung
внешняя peak bandwidth
preliminary Llama 3.1 8B
два 64-bit ranks
Вопросы и ответы
Заменит ли LPDDR5X-PIM HBM?
Почему 614 GB/s — не внешняя шина?
Когда появятся массовые устройства?
Источники и проверка
- Samsung SemiconductorSamsung unveils next-gen memory vision at FMS 2026
- Tom's HardwareHot Chips 2026: Samsung makes LPDDR5X smart with logic unit in memory
- Samsung SemiconductorLPDDR product overview




Комментарии0 комментариев
Комментарии