Hardware

Samsung LPDDR5X-PIM: xotira ichida hisoblash — AI tezlashtirishning yangi bosqichi

29-avgust, 2026, 12:160 ko'rish6 daqiqa o'qish
Samsung LPDDR5X-PIM: xotira ichida hisoblash — AI tezlashtirishning yangi bosqichi

Yillar davomida "xotira devori" (memory wall) — protsessor tezligi va DRAM bandwidth o'rtasidagi abyss — kompyuter arxitekturasining eng qiyin muammosi edi. Samsung Hot Chips 2026 da ushbu devorni buzish, emas, undan o'tish yo'lini taklif qildi: LPDDR5X-PIM (Processing-in-Memory). Asosiy g'oya oddiy — hisoblash yadroni (MAC bloklarini) DRAM chiplarining ichiga, ma'lumotlar yotgan joyiga yaqinlashtirish. Bu maqola arxitektura tafsilotlari, dasturlash modeli va amaliy cheklovlar haqida.

Nega DRAM ichida hisoblash kerak?

Oddiy arxitekturada ma'lumot DRAM dan protsessorga (CPU/GPU/NPU) ko'chiriladi, hisoblash amalga oshiriladi, natija qaytariladi. Bu yo'l — xotira interfeysi (bus) — cheklov. LPDDR5X-9600 da tashqi bandwidth 76.8 GB/s ga yetadi. Ichki tarafta esa 16 ta bank parallel ishlayotganda 614 GB/s ga erishadi. Samsung bu ichki potensialni ochdi: har bir bankga o'z MAC blokini (PIM block) qo'shdi. Natijada ma'lumot chipdan chiqmasdan, o'zi joyida qayta ishlanadi.

Bu yondashuv yangi emas — UPMEM, AxDIMM, HBM-PIM kabi loyihalar ham mavjud edi. Samsung farqi: ular standart LPDDR5X protokolini to'liq saqladi. Xotira kontrolleri o'zgartirilsin dema, maxsus qator manzillari (row addresses) orqali boshqaruv o'rnatildi. Bu mobil va server platformalariga integratsiyani sezilarli soddalashtiradi.

Arxitektura: bank har birida MAC daraxti

Har bir LPDDR5X-PIM chipida 16 ta bank bor. Har bir bankga alohida PIM blok biriktirilgan. PIM blok tarkibi:

  • MAC daraxti (MAC tree) — past aniqlikdagi ko'paytirish-qo'shish operatsiyalari uchun.
  • Instruksiya registr fayli (1024 bit) — 64 tagacha 16-bit instruksiya saqlaydi.
  • Manba registr fayli (4 kbit) — aktivatsiya vektorlari (birinchi operand).
  • Masshtablash registri (2 kbit) — vaznlar uchun koeffitsientlar.
  • Vaznlar — oddiy DRAM bankida saqlanadi, ikkinchi operand sifatida xizmat qiladi.

Har bir PIM bloki soat tsikli (double data rate hisoblanmasdan) 8 ta INT8/FP8 MAC operatsiyasini bajaradi. 16 bank parallel ishlayotganda — paket bo'yicha 2.4 TOPS (INT8). Bu son kichik tuyulishi mumkin: masalan, Intel Meteor Lake NPU 11.5 TOPS beradi. Lekin 8 ta LPDDR5X-PIM chipli (128 GB xotira) tizimida jami 9.6 TOPS — ya'ni bitta NPU ga yaqin natija. Farqi: bu xotira ham, tezlashtiruvchi ham birga.

Standart protokol ichida "yashirin" boshqaruv

Eng aqlli qism — Samsung qanday standart LPDDR5X buyruqlari orqali PIM ni boshqarishni topdi. Ular maxsus qator manzillarini ajratib oldi, ular MMIO (Memory-Mapped I/O) manzillari kabi ishlaydi:

  • Rejim boshqaruv qatorlari: bitta — single-bank (oddiy rejim), ikkinchisi — multi-bank (barcha 16 bank parallel).
  • Bankiga xos maxsus qatorlar: ularni faollashtirganda o'qish/yozish buyruqlari DRAM emas, PIM registrlariga yo'naltiriladi (PIM Registers Activated mode).

Ish jarayoni quyidagicha: dastur avval oddiy single-bank rejimida model vaznlarini DRAM ga yuklaydi. Keyin multi-bank rejimiga o'tadi, PIM registrlarini faollashtiradi. Aktivatsiya vektorlari, masshtablash koeffitsientlari va operatsiya kodi — barchasi 16 ta bankga broadcast (yayilma) yozuvi bilan bir xil yoziladi. Bu SIMD (Single Instruction, Multiple Data) modeli — lekin juda cheklangan: barcha banklarda bitta operatsiya, bitta masshtablash, bitta manba operandi. Vaznlar (ikkinchi operand) har bankda o'ziga xos (DRAM dan keladi).

Yozish bandwidth cheklovini hal qilish uchun: har bir DRAM paketi 256 bit (BL=16). Bitta manba registrini to'ldirish 16 ta yozish buyrugi kerak. Agar single-bank rejimida har bank alohida to'ldirilsa — 256 ta buyrugi kerak bo'lardi, bu host-PIM bandwidth ni bo'sh turib tutardi. Shuning uchun multi-bank broadcast majburiy.

Address Align Mode: kontroller tartibini hal qilish

Xotira kontrollerlari odatda buyruqlarni qayta tartiblaydi (reorder) — bandwidth ni optimallashtirish uchun. PIM da bu xavfli: instruksiya 1 manba registri 1-elementini, instruksiya 2 — 2-elementini kutadi. Agar kontroller tartibni o'zgartirsa, natija noto'g'ri chiqadi. Samsung Address Align Mode (AAM) ni joriy etti: har bir instrukkiya o'z manba indeksini ustun manzilidan (column address) avtomatik oladi. Bu kontroller qanday tartiblasa, hisoblash to'g'ri ishlaydi.

Dasturlash modeli: qulay emas, lekin ishlaydi

Samsung ichki testlarida LPDDR5X-PIM dan oddiy LPDDR5X ga nisbatan katta tezlanish ko'rsatgan. Lekin dasturchi uchun bu — yangi dard sarishi:

  • Ma'lumot oqimini boshqarish: rejimlar o'tishlari (single↔multi, PIM registers on/off) kerak.
  • Vaznlar DRAM da, aktivatsiyalar PIM registrlarida — bu ma'lumot joylashuvini tahminan talab qiladi.
  • Natijalar VRF (Vector Register File) da yig'iladi, keyin DRAM ga yoziladi — yana bir bosqich.
  • Kompilyator/Framework qo'llab-quvvatlashi (PyTorch, ONNX Runtime, TVM) hali boshlang'ich bosqichda.

Bu "yumshoq" texnika emas — kernel darajasida, hatto driver darajasida integratsiya kerak. Mobil SoC larda (Exynos, Snapdragon) xotira kontrolleri yopiq bo'lgani uchun, bu texnologiya avval server/DRAM modul (DIMM) shaklida, HBM-PIM kabi kelishi ehtimol.

Amaliy cheklovlar va savollar

  • Hisoblash kuchining qisqarligi: 2.4 TOPS/paket — bu faqat INT8/FP8. FP16/BF16 yo'q. Katta modellar uchun yuzlab chiplar kerak — bu qimmat va issiqlik manbasi.
  • Xotira hajmi bog'lanishi: 8 chipli 128 GB beradi. Agar model 16 GB ga sig'sa, qolgan 112 GB bo'sh turadi — resurs sarfi.
  • Bandwidth asimmetrikasi: Host→PIM yozish (broadcast) tez, lekin PIM→Host o'qish (natijalarni olish) oddiy DRAM o'qish tezligida (76.8 GB/s). Bu darajali pipelining kerak.
  • Standartlashtirish: JEDEC hali PIM buyruqlarini standartlashtirmagan. Har bir vendor (Samsung, SK Hynix, Micron) o'z protokolini yaratishi ekosistemani parchalashtiradi.

Kelajak: mobil, server, yoki ikkalasi?

LPDDR5X-PIM — bu mobil xotira standarti. Lekin mobil chiplarda (smartfon) NPU allaqachon bor va u 10-50 TOPS beradi. PIM ning afzalligi: model o'zgartirganda (masalan, yangi LoRA adapter) faqat DRAM ga yozish yetarli, NPU microcode yangilash shart emas. Bu inference-time adaptatsiya uchun qulay.

Server tarafida Samsung HBM-PIM (HBM2/3 ga MAC bloklari) ni ham rivojlantiriyor. HBM bandwidth 1 TB/s+ — waha PIM bloklari uchun ancha katta maydon. Agar HBM-PIM paket bo'yicha 50-100 TOPS bersa, bu GPU/NPU ga haqiqiy raqobat bo'ladi, chunki xotira bandwidth cheklovi yo'qoladi.

Xulosa: muhim qadam, lekin yo'l uzoq

Samsung LPDDR5X-PIM — bu PIM ni laboratoriyadan chiqarib, standart xotira moduli shaklida ishlab chiqarishga yaqinlashtirgan katta muhandislik yutuq. Protokol uygunligi, Address Align Mode, broadcast SIMD modeli — bu haqiqiy ishlovchi silikon, necha PowerPoint slayd emas.

Ammo "xotira ichida hisoblash" hali ham universal yechim emas. U maxsus ish yuklamalari uchun: kichik modellar, past aniqlik, katta batch size, tez model o'zgarishi. Umumiy maqsadli tezlashtiruvchi (GPU/NPU) o'rni emas, qo'shimcha qatlam. Kelgusi 2-3 yilda framework qo'llab-quvvatlashi va JEDEC standarti paydo bo'lmasa, bu texnologiya nichalik maxsus server DIMM lari va mobil SoC larning ichki xotira kontrollerlariga cheklanib qoladi.

Hozircha bu — arxitekturaga qiziqish bilen qarab turgan muhandislar uchun kuchli signal: xotira faqat saqlash uchun emas, hisoblash uchun ham mo'ljallangan. Keyingi bosqich — dasturiy ta'minot ekosistemasi.

Asl manba: chipsandcheese.com

Manba: Hacker News
#Samsung #PIM #LPDDR5X #AI acceleration #Hot Chips 2026
Telegram da muhokama qilish