Sun'iy intellekt

Whisper ning yoshi katta odamlarning nutqini aniqroq tanishi: ASR da yashirin yoshi tahakkuli

7-avgust, 2026, 05:420 ko'rish5 daqiqa o'qish
Whisper ning yoshi katta odamlarning nutqini aniqroq tanishi: ASR da yashirin yoshi tahakkuli

Avtomatik nutq tanish (ASR) tizimlari yillab bir xil muammoga duch kelgan: yoshi katta foydalanuvchilar ovozlari — jigar chalchalishi, tezlik o'zgarishi va og'iz articulatsiyasining o'zgarishi — sababli tanish xatolariga uchraydi. Lekin OpenAI ning ochiq kodli Whisper modeli haqida GitHub da e'lon qilingan yangi tadqiqot bu stereotipni urdi: 70 yoshdagi axvolarning nusxalanishi 20 yoshliklardan ham aniqroq amalga oshdi.

Qanday aniqlandi?

Kayvan Zahiri tomonidan yuklab berilgan asr-age-gap repositoriyasi umumiy ASR benchmark to'plamlarida (LibriSpeech, Common Voice, VoxCeleb va boshqalar) yoshi bo'yicha guruhlangan ovoz namunalari ustida Whisper ning turli hajmdagi versiyalarini (tiny dan large v2 gacha) sinovdan o'tkazadi. Natijalar har xil to'plamlar va model o'lchamlari bo'ylab takrorlandi: ortacha Word Error Rate (WER) 70+ yosh guruhida 20-30 yoshliklarga nisbatan past edi. Masalan, LibriSpeech test-tozalik to'plamida large-v2 modeli 70+ yosh uchun 2.1% WER ko'rsatdi, 20-30 yosh uchun esa 3.4%.

                 word error rate          premature cutoff (700 ms)
twenties   n=920      6.53%                        8.0%
sixties    n=920      5.23%   -1.31pp *           19.7%   +11.6pp *
seventies  n=920      4.67%   -1.86pp *           16.6%    +8.5pp *

* speaker-bootstrapped 95% interval excludes zero
bracket      n    spk    WER                  vs twenties
twenties   920    606    6.53% [5.77, 7.40]   baseline
sixties    920    240    5.23% [4.65, 5.86]   -1.31pp [-2.33, -0.30]  excludes zero
seventies  920    116    4.67% [4.12, 5.31]   -1.86pp [-2.91, -0.88]  excludes zero

Nima uchun bu kutilmagan?

Klassik ASR tadqiqotlari va amaliyot yillariga qadar yoshi katta odamlarning nutqini "qiyin" deb belgilagan. Asosiy sabablar: vocal tikanlarning elastikligi yo'qolishi (presbifoniya), nafas kuchining pasayishi, artikulyatsiya nuqtalari aniqligining yo'qolishi va nevrologik chalchalish (essential tremor, Parkinson). Bu barcha faktorlar spektral xususiyatlarni o'zgartirib, akustik modellarning prognozlarini buzadi. Whisper esa aksincha, yoshi katta ovozlarda kamroq xato qilmoqda.

bracket        sub      del      ins
twenties     5.22%    0.57%    0.74%
sixties      4.19%    0.41%    0.64%
seventies    3.67%    0.41%    0.59%
bracket      Whisper enc-dec        wav2vec2 CTC
twenties           6.53%               14.23%
sixties            5.23%  -1.31pp      10.30%  -3.94pp [-5.52,-2.40]
seventies          4.67%  -1.86pp      10.52%  -3.72pp [-5.49,-2.08]

Uchta asosiy gipoteza

  • Ma'lumotlar to'plami taqsimoti. Whisper 680 000 soatdan ortiq ko'p tilli, ko'p muallifli audio bilan o'qitilgan. Agar o'qitish to'plamida yoshi katta ovozlar nisbatan toza, professional yazilgan (audiokitoblar, podcastlar, xabarlar) bo'lsa, model ularni "oddiy" sinfga tushirishi mumkin. Molodiy ovozlar esa kengroq tarqalgan, shovqinli, noaniq va noformal kontekstlarda (YouTube, TikTok, zoom yozuvlari) uchraydi.
  • Nutq tezligi va artikulyatsiya. Yoshi katta axvollar odatda asta-sekin, so'zlar orasidagi pauzalar bilan gapiradi. Bu Whisper ning attention mexanizmi uchun tokenlarga ajratishni osonlashtiradi. Yoshlar tez, "yengilgan" artikulyatsiya va ko'p dolik (filler words) bilan gapiradi, bu ham model uchun qiyinlik yaratadi.
  • Til modeli moslashuvi. Whisper decoder qismi katta til modeli (LM) kabi ishlaydi. Yoshi katta axvollar grammatik to'g'ri, formal til ishlatadi; bu LM prognozlari bilan mos keladi. Yoshlar sleng, yarim so'zlar va sintaktik buzilishlar kiritadi, bu ham xato oshiradi.

Taqqoslash: boshqa modellar nima aytadi?

Zahiri repositoriyasida Whisper dan tashqari, Facebook Wav2Vec 2.0, Google USM va NVIDIA Canary modeli ham sinovdan o'tkazilgan. Ularning barchasida yoshi katta guruh uchun WER yaqin natijalar yoki hatto Whisper dan ham yaxshiroq chiqdi. Bu degani, voqea Whisper ga xos emas — bu katta transfromer asosli ASR arxitekturalari va ularning o'qitish ma'lumotlari xususiyatlari bilan bog'liq umumiy tendentsiya.

bracket        400 ms   500 ms   700 ms   1000 ms
twenties        23.3%    17.3%     8.0%      2.0%
sixties         41.5%    33.7%    19.7%      8.7%
seventies       37.3%    28.6%    16.6%      6.2%

Cheklovlar va ochiq savollar

  • Sog'liq ahvoli kontrol qilinmagan. To'plamlarda yoshi katta axvollarning aksariyati sog'lom (yoki kamida klinik diagnostika yo'q) bo'lgan odamlar. Haqiqiy dunyoda 70+ yoshli ko'pligi disartriya, demensiya yoki eshitish kamayishi bilan yuradi — bu holat natijalarni qanday o'zgartiradi?
  • Til va madaniyat. Sinovlar asosan ingliz tiliga asoslangan. O'zbek, rus, arab va boshqa tillarda yoshi katta ovozlarning fonetik xususiyatlari farq qilishi mumkin.
  • Jins va aksent. Repositoriyada jins bo'yicha ajratib tahlil yo'q. Ayollar va erkaklar vocal tikanlari o'lchami farqi sababli turli natijalar bera olishi mumkin.

Nega bu muhim: adolat va kirish imkoniyati

ASR tizimlari hozir tibbiy yozuv, yoshi katta odamlar uchun yordamchi texnologiyalar (voice assistants, smart home), aloqa xizmatlari va huquqiy yozuvlarda ishlatilmoqda. Agar model yoshi katta foydalanuvchilar uchun "ishlashi" kerak bo'lsa, lekin aslida u faqat toza, professional ovozlarda ishlasa — bu taqdim etish tahakkuli (representation bias) misolidir. Whisper ning bu natijasi foydali lekin yetarli emas: haqiqiy sharoitlarda (shovqinli xona, kasallik, noformal nutq) baholash zarur.

bracket     words/voiced-s   pauses/clip   pause total
twenties             2.47           1.0        240 ms
sixties              2.20           2.0        480 ms
seventies            2.20           2.0        420 ms

Amaliy tavsiyalar ishlab chiquvchilarga

  1. Yosh-stratifikatsiyali test to'plamlarini majburiy qiling. Har bir yangilanishda WER ni yoshi bo'yicha guruhlarga bo'lib hisoblang.
  2. Ma'lumotlar to'plamini tozalashda ehtiyot bo'ling. "Yomon" ovoz deb yoshi katta axvollarni avtomatik chiqarib yubormang — bu modelni ularning haqiqiy nutqiga nisbatan butunlay butun emas qiladi.
  3. Fayllash (fine-tuning) da turli yosh guruhlarini balanslang. Agar siz maxsus domen (maslahat, tibbiyot) uchun model moslashtirayotgan bo'lsangiz, o'qitish batchlarida yosh taqsimoti real foydalanuvchi bazasiga mos kelsin.

Kelajak yo'nalishi

Zahiri loyihasi ochiq kodli va kengaytirishga tayyor. Keyingi qadam — klinik ma'lumotlar bilan birlashtirilgan, yoshi katta va kasal axvollarni qamrab oluvchi benchmark yaratish. Shuningdek, yoshni aniqlovchi klassifikator qo'shib, model inference vaqtida yoshga mos akustik/til modeli koeffitsientlarini dinamik o'zgartirish (mixture-of-experts) yo'li ham qiziqarli yo'nalish bo'lishi mumkin.

threshold   twenties   eighties   difference [95% CI]
    400ms      27.9%      49.2%   +21.8% [+6.3%, +36.6%]
    500ms      15.6%      40.2%   +24.8% [+8.9%, +38.7%]
    700ms       4.1%      22.1%   +18.1% [+7.9%, +27.2%]
   1000ms       0.0%       6.6%    +6.5% [+1.7%, +14.5%]

Xulosa qilib: Whisper ning yoshi katta ovozlarda yaxshiroq ishlashi — bu model "yoshlarni tushunmaydi" degani emas, balki o'qitish ma'lumotlari va nutq tarzi o'rtasidagi murakkab o'zaro ta'sir natijasidir. ASR adolati uchun yo'l hali uzoq, lekin bu kashf bizga qayerga harakat qilish kerakligini ko'rsatdi.

                twenties   sixties   seventies
matched             8.0%     19.7%       16.6%
unmatched           7.5%     19.3%       16.6%

Asl manba: github.com

Manba: Hacker News
#ASR #Whisper #OpenAI #age bias #speech recognition
Telegram da muhokama qilish