Privatemode AI GLM-5.3-Flashni Jev-ga o'xshash qaror modeliga aylantirish usulini taqdim etdi. Bu usul bir martalik o'tkazishda har bir variant uchun ehtimoliyatni aniqlaydi. Bu yondashuv LLMlarni Jev-ga o'xshash qaror modellari sifatida ishlatishga imkon beradi.
Bu usulning samaradorligini baholash uchun Privatemode-da ishlaydigan GLM-5.3-Flashni ishlatildi. Umumiy ma'lumotlar bazalaridan tuzilgan standartga asoslangan baholash natijalari shuni ko'rsatdiki, bu yondashuv TypeSafe Jevning qaror aniqligi va tezligi bilan tenglashtirilishi mumkin.
Bu yondashuvning yana bir afzalligi shundaki, u rasmlarni tahlil qilish imkonini beradi, bu esa Jevda mumkin emas.
LLMlarning qaror qabul qilishdagi roli
Ko'p hollarda dasturiy ta'minot LLMlardan qarorlar oladi. Masalan, "Qaysi jamoa bu tiketni boshqarishi kerak?" yoki "Bu shartnoma bandi javobgarlik bo'limiga tegishli?". Bu holatlarda dasturiy ta'minot LLMning javobini JSON formatida va belgilangan variantlar ro'yxatidan kelishini talab qiladi.
LLMlar bu talablarni bajarishi mumkin, lekin bu yondashuv tezlik va xarajatlar bilan bog'liq muammolarni keltirib chiqaradi. Har bir qaror uchun LLM butun JSON obyektini yozishi kerak bo'lishi mumkin va bu jarayon uzoq vaqt olishi mumkin.
Jev va Laya kabi maxsus qaror modellari bu muammolarni hal qilish uchun mo'ljallangan. Ular holatning bir qismini va nomlangan variantlarni kirish sifatida oladi va tanlangan variantni va har bir variant uchun ishonch darajasini qaytaradi.
LLMlarni qaror modellari sifatida ishlatish
Bizning maqsadimiz LLMlarni Jev-ga o'xshash xususiyatlarga ega qaror modellari sifatida ishlatishga imkon berish edi. Qisqa javob: "ha". Keyingi qismda bu usulning ish prinsipini ko'rsatamiz.
LLMlarning ishlash prinsipi
LLMlar aslida matnni to'g'ridan-to'g'ri yozmaydi. Ular so'rovga javob berish uchun butun lug'atidagi tokenlarning ehtimoliyat taqsimotini chiqaradi. Matn yaratishda, eng yuqori ehtimoliyatga ega bo'lgan token tanlanadi va bu jarayon takrorlanadi. Bu usul JSON obyektini yaratishda juda sekin va qimmat bo'lishi mumkin.
Bizning asosiy fikrimiz shundaki, LLM butun JSON obyektini bashorat qilishiga ehtiyoj yo'q, chunki biz uning shaklini bilamiz. Biz faqat LLMning belgilangan kiritish uchun tipik bahosini olishni xohlaymiz.
Biz shuni aniqladikki, so'rovlarni shunday tuzish mumkinki, LLM bir marta ishga tushirilganda tipik bahoni olish mumkin. Bu Jev va Laya kabi maxsus ta'lim olgan modellardan farqli o'laroq.
Usulning ishlash prinsipi
Usulning ishlash prinsipi quyidagicha:
- Variantlarni raqamlashtirish. Holat, savol va chiqish variantlari JSON formatida so'rovga kiritiladi, har bir variant uchun indeks beriladi. Bu LLMni tanlov indeksi bilan javob berishni so'raydi.
- Javobni oldindan to'ldirish. So'rov
choice_index: bilan tugaydi. Shunday qilib, LLM birinchi marta chiqaradigan token belgilangan variantlar indeksiga tegishli bo'ladi.
- Chiqishni baholash. LLM chiqaradigan tokenni o'qish o'rniga, biz uning har bir variant uchun bergan ehtimoliyatlarni o'qiyapmiz. Bu variantlar bo'yicha normalizatsiya qilingan ehtimoliyatlarni beradi va biz eng yuqori ehtimoliyatga ega bo'lgan variantni tanlaymiz.
Biz ushbu qadamlarni Privatemode-da ishlaydigan GLM-5.3-Flash uchun amalga oshirdik. Biz /chat/completions endpointini continue_final_message va add_generation_prompt: false parametrlarini ishlatamiz, chunki bu LLMni ikkinchi qadamdan boshlab davom ettirishga imkon beradi. Bundan tashqari, bu matn bilan birga rasmlarni yuborish imkonini beradi, bu esa rasmlarni tahlil qilish imkonini beradi.
Texnik tafsilotlar
vLLM va GLM-5.3-Flash uchun quyidagi tafsilotlar muhim:
vLLM'ning allowed_token_ids parametri LLMning chiqish lug'atini faqat belgilangan variantlarga cheklash uchun ishlatiladi. Bu himoya chizig'i bo'lib, talab emas.
top_logprobs uchinchi qadam uchun yetarli emas. U taqiqlash amalda bo'lmaguncha taqsimotni hisoblaydi, shuning uchun formatlash tokenlari yuqori o'rinda bo'lishi mumkin va ba'zi variantlar ro'yxatdan tushib ketishi mumkin.
vLLM'ning logprob_token_ids parametri bu muammoni hal qiladi: u so'ralgan token identifikatorlarining log ehtimoliyatini qaytaradi.
- Indeks tokenlari modelning tokenizatoriga bog'liq. Raqamlar har doim alohida tokenlar emas. Masalan, GLM-5.3-Flashda
12 uchun alohida token mavjud.
Bizning implementatsiyamizni quyidagi resursda topishingiz mumkin: edgelesssys/privatemode-decisions. Bu Python kutubxonasi token orakul, so'rov, maskirovka va normalizatsiyani har qanday vLLM-ga asoslangan endpointga qarshi amalga oshiradi.
Quyidagi o'yin maydonida Privatemode-da GLM-5.3-Flashni yuqoridagi sozlamada so'rov qilish mumkin. Misollar orasida skanerlangan hisob-faktura va mahalliy vaqtga bog'liq savollar mavjud. Har bir javob variantlar bo'yicha taqsimot sifatida qaytariladi, odatda bir necha yuz millisekund ichida.
Asl manba: privatemode.ai