Avtomatik nutq tanish (ASR) tizimlari yillab bir xil muammoga duch kelgan: yoshi katta foydalanuvchilar ovozlari — jigar chalchalishi, tezlik o'zgarishi va og'iz articulatsiyasining o'zgarishi — sababli tanish xatolariga uchraydi. Lekin OpenAI ning ochiq kodli Whisper modeli haqida GitHub da e'lon qilingan yangi tadqiqot bu stereotipni urdi: 70 yoshdagi axvolarning nusxalanishi 20 yoshliklardan ham aniqroq amalga oshdi.
Qanday aniqlandi?
Kayvan Zahiri tomonidan yuklab berilgan asr-age-gap repositoriyasi umumiy ASR benchmark to'plamlarida (LibriSpeech, Common Voice, VoxCeleb va boshqalar) yoshi bo'yicha guruhlangan ovoz namunalari ustida Whisper ning turli hajmdagi versiyalarini (tiny dan large v2 gacha) sinovdan o'tkazadi. Natijalar har xil to'plamlar va model o'lchamlari bo'ylab takrorlandi: ortacha Word Error Rate (WER) 70+ yosh guruhida 20-30 yoshliklarga nisbatan past edi. Masalan, LibriSpeech test-tozalik to'plamida large-v2 modeli 70+ yosh uchun 2.1% WER ko'rsatdi, 20-30 yosh uchun esa 3.4%.
word error rate premature cutoff (700 ms)
twenties n=920 6.53% 8.0%
sixties n=920 5.23% -1.31pp * 19.7% +11.6pp *
seventies n=920 4.67% -1.86pp * 16.6% +8.5pp *
* speaker-bootstrapped 95% interval excludes zero
bracket n spk WER vs twenties
twenties 920 606 6.53% [5.77, 7.40] baseline
sixties 920 240 5.23% [4.65, 5.86] -1.31pp [-2.33, -0.30] excludes zero
seventies 920 116 4.67% [4.12, 5.31] -1.86pp [-2.91, -0.88] excludes zero
Nima uchun bu kutilmagan?
Klassik ASR tadqiqotlari va amaliyot yillariga qadar yoshi katta odamlarning nutqini "qiyin" deb belgilagan. Asosiy sabablar: vocal tikanlarning elastikligi yo'qolishi (presbifoniya), nafas kuchining pasayishi, artikulyatsiya nuqtalari aniqligining yo'qolishi va nevrologik chalchalish (essential tremor, Parkinson). Bu barcha faktorlar spektral xususiyatlarni o'zgartirib, akustik modellarning prognozlarini buzadi. Whisper esa aksincha, yoshi katta ovozlarda kamroq xato qilmoqda.
bracket sub del ins
twenties 5.22% 0.57% 0.74%
sixties 4.19% 0.41% 0.64%
seventies 3.67% 0.41% 0.59%
bracket Whisper enc-dec wav2vec2 CTC
twenties 6.53% 14.23%
sixties 5.23% -1.31pp 10.30% -3.94pp [-5.52,-2.40]
seventies 4.67% -1.86pp 10.52% -3.72pp [-5.49,-2.08]
Uchta asosiy gipoteza
- Ma'lumotlar to'plami taqsimoti. Whisper 680 000 soatdan ortiq ko'p tilli, ko'p muallifli audio bilan o'qitilgan. Agar o'qitish to'plamida yoshi katta ovozlar nisbatan toza, professional yazilgan (audiokitoblar, podcastlar, xabarlar) bo'lsa, model ularni "oddiy" sinfga tushirishi mumkin. Molodiy ovozlar esa kengroq tarqalgan, shovqinli, noaniq va noformal kontekstlarda (YouTube, TikTok, zoom yozuvlari) uchraydi.
- Nutq tezligi va artikulyatsiya. Yoshi katta axvollar odatda asta-sekin, so'zlar orasidagi pauzalar bilan gapiradi. Bu Whisper ning attention mexanizmi uchun tokenlarga ajratishni osonlashtiradi. Yoshlar tez, "yengilgan" artikulyatsiya va ko'p dolik (filler words) bilan gapiradi, bu ham model uchun qiyinlik yaratadi.
- Til modeli moslashuvi. Whisper decoder qismi katta til modeli (LM) kabi ishlaydi. Yoshi katta axvollar grammatik to'g'ri, formal til ishlatadi; bu LM prognozlari bilan mos keladi. Yoshlar sleng, yarim so'zlar va sintaktik buzilishlar kiritadi, bu ham xato oshiradi.
Taqqoslash: boshqa modellar nima aytadi?
Zahiri repositoriyasida Whisper dan tashqari, Facebook Wav2Vec 2.0, Google USM va NVIDIA Canary modeli ham sinovdan o'tkazilgan. Ularning barchasida yoshi katta guruh uchun WER yaqin natijalar yoki hatto Whisper dan ham yaxshiroq chiqdi. Bu degani, voqea Whisper ga xos emas — bu katta transfromer asosli ASR arxitekturalari va ularning o'qitish ma'lumotlari xususiyatlari bilan bog'liq umumiy tendentsiya.
bracket 400 ms 500 ms 700 ms 1000 ms
twenties 23.3% 17.3% 8.0% 2.0%
sixties 41.5% 33.7% 19.7% 8.7%
seventies 37.3% 28.6% 16.6% 6.2%
Cheklovlar va ochiq savollar
- Sog'liq ahvoli kontrol qilinmagan. To'plamlarda yoshi katta axvollarning aksariyati sog'lom (yoki kamida klinik diagnostika yo'q) bo'lgan odamlar. Haqiqiy dunyoda 70+ yoshli ko'pligi disartriya, demensiya yoki eshitish kamayishi bilan yuradi — bu holat natijalarni qanday o'zgartiradi?
- Til va madaniyat. Sinovlar asosan ingliz tiliga asoslangan. O'zbek, rus, arab va boshqa tillarda yoshi katta ovozlarning fonetik xususiyatlari farq qilishi mumkin.
- Jins va aksent. Repositoriyada jins bo'yicha ajratib tahlil yo'q. Ayollar va erkaklar vocal tikanlari o'lchami farqi sababli turli natijalar bera olishi mumkin.
Nega bu muhim: adolat va kirish imkoniyati
ASR tizimlari hozir tibbiy yozuv, yoshi katta odamlar uchun yordamchi texnologiyalar (voice assistants, smart home), aloqa xizmatlari va huquqiy yozuvlarda ishlatilmoqda. Agar model yoshi katta foydalanuvchilar uchun "ishlashi" kerak bo'lsa, lekin aslida u faqat toza, professional ovozlarda ishlasa — bu taqdim etish tahakkuli (representation bias) misolidir. Whisper ning bu natijasi foydali lekin yetarli emas: haqiqiy sharoitlarda (shovqinli xona, kasallik, noformal nutq) baholash zarur.
bracket words/voiced-s pauses/clip pause total
twenties 2.47 1.0 240 ms
sixties 2.20 2.0 480 ms
seventies 2.20 2.0 420 ms
Amaliy tavsiyalar ishlab chiquvchilarga
- Yosh-stratifikatsiyali test to'plamlarini majburiy qiling. Har bir yangilanishda WER ni yoshi bo'yicha guruhlarga bo'lib hisoblang.
- Ma'lumotlar to'plamini tozalashda ehtiyot bo'ling. "Yomon" ovoz deb yoshi katta axvollarni avtomatik chiqarib yubormang — bu modelni ularning haqiqiy nutqiga nisbatan butunlay butun emas qiladi.
- Fayllash (fine-tuning) da turli yosh guruhlarini balanslang. Agar siz maxsus domen (maslahat, tibbiyot) uchun model moslashtirayotgan bo'lsangiz, o'qitish batchlarida yosh taqsimoti real foydalanuvchi bazasiga mos kelsin.
Kelajak yo'nalishi
Zahiri loyihasi ochiq kodli va kengaytirishga tayyor. Keyingi qadam — klinik ma'lumotlar bilan birlashtirilgan, yoshi katta va kasal axvollarni qamrab oluvchi benchmark yaratish. Shuningdek, yoshni aniqlovchi klassifikator qo'shib, model inference vaqtida yoshga mos akustik/til modeli koeffitsientlarini dinamik o'zgartirish (mixture-of-experts) yo'li ham qiziqarli yo'nalish bo'lishi mumkin.
threshold twenties eighties difference [95% CI]
400ms 27.9% 49.2% +21.8% [+6.3%, +36.6%]
500ms 15.6% 40.2% +24.8% [+8.9%, +38.7%]
700ms 4.1% 22.1% +18.1% [+7.9%, +27.2%]
1000ms 0.0% 6.6% +6.5% [+1.7%, +14.5%]
Xulosa qilib: Whisper ning yoshi katta ovozlarda yaxshiroq ishlashi — bu model "yoshlarni tushunmaydi" degani emas, balki o'qitish ma'lumotlari va nutq tarzi o'rtasidagi murakkab o'zaro ta'sir natijasidir. ASR adolati uchun yo'l hali uzoq, lekin bu kashf bizga qayerga harakat qilish kerakligini ko'rsatdi.
twenties sixties seventies
matched 8.0% 19.7% 16.6%
unmatched 7.5% 19.3% 16.6%
Asl manba: github.com