Sun'iy intellekt

Strata yordamida Qwen 3.8 Flash Next 125B modelini RTX 4090’da 100 token/s tezlikda ishga tushirish

4-oktabr, 2026, 18:382 ko'rish5 daqiqa o'qish
Strata yordamida Qwen 3.8 Flash Next 125B modelini RTX 4090’da 100 token/s tezlikda ishga tushirish

Sun'iy intellekt modellari yirik server infrastrukturasi talab qilishi odatiy hol bo‘lsa-da, Strata loyihasi ushbu cheklovni yengib, 125 milliard parametrli Qwen 3.8 Flash Next modelini oddiy gamer PC’da ham ishga tushirish imkonini beradi. Ushbu maqola modelning texnik talablari, o‘rnatish jarayoni, real dunyo sinov natijalari hamda boshqa platformalar bilan solishtirishni batafsil tahlil qiladi.

Texnik fon va Strata arxitekturasi

Strata – ochiq kodli, platforma‑mustaqil AI serveri bo‘lib, GPU‑acceleratsiya, RAM va disk resurslarini avtomatik tahlil qilib, mos model versiyasini tanlaydi. Dastur CUDA (NVIDIA) yoki ROCm (AMD) drayverlari bilan integratsiyalashgan, shuningdek, bir nechta GPUni birgalikda ishlatish (multi‑GPU) imkoniyatini ham qo‘llab‑quvvatlaydi. Modelning har bir versiyasi (IQ2_XS, IQ3_S, Unsloth UD‑IQ4_XS va boshqalar) turli siqilish darajalariga ega bo‘lib, RAM hajmi va VRAM miqdoriga qarab tanlanadi.

A voxel pagoda garden that Strata's model wrote, running in the browser

Talablar va tavsiya etilgan konfiguratsiya

  • Grafik karta: NVIDIA GeForce RTX 20/30/40/50 seriyalari yoki AMD Radeon RX 7900 XT/XTX, RX 7800 XT, RX 9070 XT kabi 12 GB yoki undan ko‘proq VRAMga ega modellari.
  • Operativ xotira: kamida 32 GB, 64 GB tavsiya etiladi – bu barcha model o‘lchamlarini bir vaqtning o‘zida yuklash imkonini beradi.
  • Disk: 80 GB bo‘sh joy, SSD (NVMe) afzallik beradi, chunki birinchi yuklashda 35‑55 GB RAMga yuklanadi.
  • Tizim: Windows 10/11 yoki zamonaviy Linux distributivi, yangilangan NVIDIA/AMD drayverlari.

Strata o‘rnatgichlari avtomatik ravishda GPU turini aniqlab, mos “engine” (masalan, 0.1.36 yoki 0.1.26) ni tanlaydi, shuningdek, model hajmi, kontekst uzunligi (32 K token) va tasvirni o‘qish imkoniyatini so‘raydi.

Amaliy sinov natijalari: RTX 4090 va boshqa kartalar

GitHub sahifasida e'lon qilingan ma'lumotlarga ko‘ra, RTX 4090 (24 GB VRAM) da Qwen 3.8 Flash Next modelini 100‑140 token/s tezlikda ishlatish mumkin. Bu ko‘rsatkich 60 token/s o‘rtacha tezlikdan ancha yuqori bo‘lib, foydalanuvchi bir necha soniya ichida javobni ko‘ra oladi. RTX 5070 (12 GB) da esa taxminan 60 token/s, RX 9070 XT (16 GB) da ham shunga yaqin natija qayd etilgan.

Modelning “chat” rejimida tokenlar so‘zning ¾ qismini tashkil etadi, shuning uchun 100 token/s taxminan 75 so‘zni bir soniyada chiqaradi – bu inson tezligidan ancha yuqori. “Prompt” o‘qish tezligi ham muhim: 32 K tokenli hujjatni bir necha soniyada yuklash imkoniyati kod, hujjat yoki uzoq suhbat tarixini birgalikda ishlashni osonlashtiradi.

Model variantlari va ularning xususiyatlari

Strata bir nechta model variantlarini taklif etadi, ularning har biri RAM va VRAMga mos ravishda siqilgan:

  • Coder: 32 GB RAM uchun mo‘ljallangan, kod yozish bo‘yicha 91 % to‘liq model darajasini saqlaydi, lekin CJK matnlarida zaif.
  • IQ2_XS / Q2_0: 48 GB RAMda eng tez variant, umumiy vazifalarda yuqori aniqlik.
  • IQ3_S: 64 GB RAMda tavsiya etilgan, eng katta kontekst va eng yuqori aniqlik, lekin sekinroq.
  • Unsloth UD‑IQ4_XS: 4‑bit siqilgan versiya, 94 GB yuklab olish hajmi, 80 GB RAMda SSD orqali dinamik yuklash talab qiladi.
  • Unsloth UD‑Q4_K_XL (eksperimental): to‘liq modelga eng yaqin, lekin 64 GB RAMda token tezligi 7‑8,5 token/s ga tushadi.

Model tanlashda foydalanuvchi o‘zining asosiy ish yukini (kod, matn, tasvir) va mavjud resurslarni hisobga olishi lozim.

The Strata app's Monitor tab next to a coding agent

Strata o‘rnatish jarayoni

O‘rnatish juda sodda: git clone https://github.com/Niko1221/Strata yoki zip arxivini yuklab olish, keyin Windowsda START-HERE.bat, Linuxda ./setup.sh ni ishga tushirish. Dastur avtomatik ravishda quyidagilarni bajaradi:

  1. GPU va RAMni tekshirish, mos modelni tanlash.
  2. Model fayllarini (taxminan 70 GB) yuklab olish.
  3. RAMga 35‑55 GB ma'lumotni yuklab, GPU uchun kerakli qismini ajratish.
  4. Mahalliy veb‑interfeysni http://127.0.0.1:8080 da ishga tushirish.

Birinchi ishga tushirishda 1‑3 daqiqagacha kompyuter sekinlashishi mumkin, bu normal holat. Keyingi ishga tushirishlar esa bir necha soniya ichida boshlanadi, chunki model avvalgi holatda keshda saqlanadi.

Raqobatchilar bilan solishtirish

OpenAI, Anthropic yoki Google kabi yirik provayderlar server‑tomonida xizmat ko‘rsatadi, foydalanuvchi faqat API kaliti orqali kiradi. Strata esa mahalliy ishga tushirishni ta'minlaydi, ya'ni ma'lumotlar kompyuterda qoladi, maxfiylik darajasi ancha yuqori. Biroq, server‑tomonli xizmatlar odatda 1‑2 token/s dan ancha tezroq (GPU klasterlari) va katta miqdordagi foydalanuvchilarni bir vaqtning o‘zida qo‘llab‑quvvatlaydi.

Shuningdek, Strata GitHub sahifasida ko‘rsatilgan eski GPU (Tesla P40, GTX 10, Radeon VII) ham modelni sekinroq, ammo ishlashga qodir tarzda ishga tushiradi. Bu esa platformaning keng qamrovli moslashuvchanligini ko‘rsatadi.

Cheklovlar va ochiq savollar

Strata hali eksperimental bosqichda, shuning uchun ba'zi xatoliklar va resurs boshqaruvi muammolari yuzaga kelishi mumkin. Katta model (IQ3_S) 64 GB RAMda ham ba'zi vazifalarda RAMni to‘liq to‘ldiradi, bu esa boshqa dasturlarni ishlashiga to‘sqinlik qiladi. SSD tezligi ham muhim – modelning bir qismi SSDdan dinamik o‘qiladi, shuning uchun eski SATA SSDda ish tezligi sezilarli darajada pasayadi.

Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.

Kelajakda quyidagi savollar hal qilinishi lozim:

  • Multi‑GPU konfiguratsiyasida skalabilitet qanday?
  • Modelni 8‑bit yoki 4‑bit siqish orqali yanada kichik RAM talabiga erishish mumkinmi?
  • Mahalliy AI agentlari (coding assistants) bilan integratsiya qanchalik silliq bo‘ladi?

Foydalanuvchi va sanoatga ta'siri

Strata yordamida mustaqil dasturchilar, tadqiqotchilar va kichik startaplar katta LLM (large language model) imkoniyatlarini arzon hardwareda sinab ko‘rishlari mumkin. Bu AI‑driven kod yozish, hujjat tahlili yoki tasvirni tushunish kabi vazifalarni mahalliy muhitda bajarish imkonini beradi, shuningdek, ma'lumotlar maxfiyligini saqlashga yordam beradi.

Korxona darajasida, Strata ichki AI xizmatlarini yaratish, test muhitlarini tezda tashkil etish va bulut xarajatlarini kamaytirish uchun foydali bo‘lishi mumkin. Biroq, katta miqdordagi foydalanuvchilarni bir vaqtning o‘zida qo‘llab‑quvvatlash uchun server‑tomonli echimlar hali ham afzalroq.

Xulosa

Strata – ochiq kodli, foydalanuvchi‑do‘st platforma bo‘lib, 125 milliard parametrli Qwen 3.8 Flash Next modelini oddiy gamer PC’da ham ishga tushirish imkonini beradi. RTX 4090 kabi zamonaviy GPUda 100 token/s tezlikda ishlash, 32 K token kontekstini qo‘llab‑quvvatlash va turli model variantlari foydalanuvchiga moslashuvchanlik beradi. Cheklovlar (RAM, SSD tezligi, eksperimental xususiyatlar) mavjud bo‘lsa-da, Strata AI‑driven ish jarayonlarini mahalliy muhitda sinab ko‘rish uchun muhim qadamdir.

Asl manba: github.com

Manba: Hacker News
#Qwen 3.8 #Strata #large language model #RTX 4090 #consumer hardware
Telegram da muhokama qilish