Dasturiy ta'minot

PSSA: Rust Tilida Yozilgan Yangi Til Modeli

30-sentabr, 2026, 11:290 ko'rish3 daqiqa o'qish
PSSA: Rust Tilida Yozilgan Yangi Til Modeli

PSSA — bu transformerni ishlatmasdan matnni o'qish va yaratish uchun mo'ljallangan kichik til modeli. Bu model matnni bir token bo'lib o'qib, takroriy holat-fazoviy qatlamdan foydalanadi. PSSA o'z vaznlarini o'zgartira oladi va epizodik xotiralar bankini saqlaydi. Bu model Rust tilida yozilgan va hech qanday PyTorch, TensorFlow yoki boshqa ML frameworkidan foydalanmaydi.

PSSAning Asosiy Xususiyatlari

PSSA quyidagi asosiy xususiyatlarga ega:

PSSA block compared with a transformer block, with the measured held-out results
  • Takroriy holat-fazoviy yadro: Olinadigan holat matrisalari to'liq kontekst oynasiga qarab emas, balki bir necha holatda ma'lumotlarni oldinga olib boradi.
  • Epizodik xotira banki: 512 ta slot bilan hiperbolik (Poincare uslubidagi) qidiruv va cheklangan top-4 qidiruv, ish jarayonida yoziladi va o'qiladi.
  • Plastik vaznlar: Tez yangilanishlar ishlaydigan narsani kuchaytiradi, yangi ma'lumotlar o'sishiga sabab bo'ladi va refraktar darvoza tezlikni cheklaydi.
  • Yopiq shakldagi konsolidatsiya: Tez plastik yangilanishlarni asosiy o'tish matrisasiga qayta qaytaradi.
  • Hech qanday framework: Rust tilida yozilgan qo'llab-quvvatlovchi linear algebra, CUDA yo'li uchun o'quv va skalar CPU referentsi.

PSSA va Transformer Modelining Taqqoslashi

PSSA va standart transformer modeli bir xil korpus, tokenizator, optimizator rejimi va parametrlar bilan taqqoslangan. Natijalar shuni ko'rsatdiki, PSSA o'rganish tezligi va matn yaratish tezligi bo'yicha transformerdan ustun turadi.

The PSSA layer, one token

12,7 million tokenlik WikiText-103 korpusida o'rganish natijalari shuni ko'rsatdiki, PSSA o'rganish xato ko'rsatkichi bo'yicha transformerdan ustun turadi. PSSA 3,98 training cross-entropy, transformer esa 4,43 training cross-entropy ko'rsatkichi bilan yakunladi. Bu 0,45 nat farqni tashkil qiladi.

Initialized decay envelopes

PSSA va transformer modellarining taqqoslash natijalari quyidagicha:

Bounded hyperbolic read
Held-out slice, 198,939 unseen tokens PSSA Transformer
Cross-entropy 3,997 4,429
Perplexity 54,4 83,8
Next-token accuracy 24,1% 18,0%

Matn yaratish tezligi bo'yicha ham PSSA transformerdan 12 marta tezroq ishlaydi. PSSA 200 tokenni 226 ms, transformer esa 2,735 ms vaqtda yaratadi.

PSSA vs parameter-matched transformer training loss

PSSAning Afzalliklari

PSSAning asosiy afzalliklari quyidagilardan iborat:

Overlap region, second half of training
  • Takroriy holat-fazoviy yadro: Kontekst oynasiga qarab emas, balki bir necha holatda ma'lumotlarni oldinga olib boradi.
  • Epizodik xotira banki: Ish jarayonida yoziladi va o'qiladi.
  • Plastik vaznlar: Tez yangilanishlar ishlaydigan narsani kuchaytiradi.
  • Yopiq shakldagi konsolidatsiya: Tez plastik yangilanishlarni asosiy o'tish matrisasiga qayta qaytaradi.
  • Hech qanday framework: Rust tilida yozilgan qo'llab-quvvatlovchi linear algebra.

PSSAning Cheklovlari

PSSA hali ham bir necha cheklovlarga ega. Ushbu model 1,5 million parametrli va 12,7 million tokenlik korpusda o'rganilgan. Bu model hali ham taniqli til modellariga raqobat berish uchun yetarli emas. Matn sifati ham hali ham past darajada.

Held-out loss per checkpoint on unseen text

PSSAning o'rganish tezligi va matn yaratish tezligi bo'yicha transformerdan ustun turishi, uning o'rganish samaradorligini ko'rsatadi. Biroq, bu model hali ham rivojlanish bosqichida va ko'p cheklovlarga ega.

delta = softplus(W_delta x)      per-channel step size,  delta in R^d_m
B     = W_B x                    input map,              B in R^d_s
C     = W_C x                    output map,             C in R^d_s

PSSAni o'rganish va rivojlantirish uchun GitHub sahifasiga o'ting.

Asl manba: github.com

Manba: Hacker News
#til modeli #Rust #transformer #o'rganish #matn yaratish
Telegram da muhokama qilish