Sun'iy intellekt

Nvidia ko'rsatdi: AI model emas, 'harness' endi asl qahramon

22-avgust, 2026, 06:421 ko'rish4 daqiqa o'qish
Nvidia ko'rsatdi: AI model emas, 'harness' endi asl qahramon

Yil avvalgi kunda AI agentlari haqidagi gaplar odatda model tanlovi atrofida aylanardi: GPT-4mi, Claudemiyoki yana qaysi 'aqlli' model. Lekin Nvidia axborot xavfsizligi va AI tadqiqotlari bo'yicha yangi ishlari bu nazariyani chuqur o'zgartirib qo'ydi. Asl masala model emas, ularni 'agent'ga aylantiruvchi uskuna — harness.

Nima sodir bo'ldi?

Juma kuni Nvidia tadqiqotchilari nashr qilgan ishda aniq ko'rsatdilar: oddiy model tanlash yetarli emas. Ular Anthropicning Claude Opus 5 modelini ARC-AGI-3 — interfaol mantiqiy benchmark — da sinab ko'rdilar. Harnesssiz natija: 30%. Bu hamma sinovdagi modellardan eng yuqori natija edi. Lekin maxsus sozlangan harness (xotira boshqaruvi va 'supervisor' nazoratchi komponenti bilan) natija 100% ga yetdi. Ya'ni model o'yinlarni odam darajasida o'ynadi.

Bu benchmark aynan shuning uchun qiziqki: bu yo'riqnomasiz 2D o'yinlar to'plami. Model o'zi o'ynash qoidalasini topishi va yutishi kerak. OpenAI o'z modellari 10% dan past natija ko'rsatgani uchun shoshilgandi va o'z tadqiqotini o'tkazdi — harness sozlamalarini o'zgartirib natijani 3 marta oshirdi, lekin 100% ga yetolmadi.

Harness nima va nima uchun u muhim?

"Dunyo agentni deyarli model APIsi sifatida tushunadi", — deb aytdi Nvidia AI bo'limi mahsulot boshqaruvi vakil-Adel El Hallack. "Lekin agent undan ko'proq narsa. Bu model. Bu model atrofidagi iskala — harness, yani u ishlatadigan vositalar to'plami. Bu runtime, skilllar va kutubxonalar."

Oddiy prompt-javob rejimidan farqli ravishda, uzoq muddatli vazifalar (long-horizon tasks) — bir necha qarorlarni, ba'zida kunlar davomida ketma-ket bajarishni talab qiladi. Model o'ziga over qolganda xotirasi to'lib ketadi, yo'lini yo'qotadi va hatto foydalanuvchi fayllarini o'chirib tashlashi yoki bazani buzishi mumkin. Microsoft apreldagi tadqiqotida 19 ta LLMni hujjat tahrirlash vazifasida sinab, barchasi xatolar to'plamini yaratganini topdi — odam shunday ishlasa, darhol ishdan bo'shatilardi.

Harness shu muammolarni hal qiladi: xotirani boshqaradi, kontekstni saqlaydi, feedback (o'z-o'zini tekshirish) mexanizmini ta'minlaydi.

Supervisor — 'CEO' roli

Nvidia yutuqining sirri — "supervisor" (nazoratchi) komponenti. Bu asosiy agent ishlagan paytda uning yonida turib, yo'lidan chetlasa qaytaradi, cho'qqida o'tirib qolgan yo'lni qayta ko'rib chiqadi. El Hallack: "Bu deyarli CEO kabi ishlaydi — agent yo'lini yo'qotganda yoki o'limli cho'qqaga yo'naganda uni to'g'ri yo'lga qaytaradi."

Supervisor kontsepsiyasi yangi emas. Lekin bugun ko'pgina foydalanuvchilar faqat bitta qatlam harnessdan foydalanyapti: Claude Code, Codex, Hermes kabi. Nvidia o'zini — Agentic Variation Operators (AVO) deb nomlangan kuchaytirilgan harnessni yaratdi. Bu Nvidia mahsuloti emas — u Nemo brendi ostida harness yaratish uchun ochiq texnologiyalar to'plamini yetkazib beradi. Ba'zisi kommersiya, ko'plabi ochiq.

Narx va boshqaruv: Databricks kashfi

Iyulda Databricks ham o'z tadqiqotini nashr etdi: bir xil model, har xil harness — 2 marta farqli xarajat. Databricks CEO Ali Ghodsi: "Siz o'ylaysiz, bu qimmat model, bu arzon model. Lekin kuting — qaysi harness? O'sha o'z-o'zida 2 marta farq qiladi."

Bu ma'nosi: model tanlovi — bu faqat yarim yo'l. Harness tanlovi esa narx, tezlik, xavfsizlik va natija aniqligiga to'g'ri ta'sir qiladi.

Ochiq harness — foydalanuvchi qolg'a egallik

Nvidia asosiysi: ochiq harnesslar, ochiq modellardagi kabi, foydalanuvchilarga ko'proq tugmachalarni (knobs) boshqarish imkonini beradi. El Hallack: "Biz ochiq agent stack (harness, infrastructure, runtime bo'yicha to'liq boshqaruv) — bu ekotizimni xavfsiz va oldinga surish uchun shart deb e'tiqod qilamiz." Bu OpenAI o'z modellarni o'qitishni sekinlashtirganiga o'xshaydi — chunki modellar xavfsizlik buzishlari mumkin edi.

Nima hali noaniq?

  • Standartlar yo'qligi: Harness uchun umumiy standartlar hali shakllanmagan. Har kompaniya o'zini yaratadi.
  • Supervisor miqyosi: Supervisor o'z-o'zida kichik model bo'lishi mumkin — bu qo'shimcha xarajat va kechikish yaratadi.
  • Xavfsizlik: Ochiq harness xavfsizlikni qanday ta'minlaydi? Kod ochiq bo'lsa, zaifliklar ham ko'rinadi.
  • Benchmark cheklovlari: ARC-AGI-3 — bu o'yinlar. Haqiqiy dunyo vazifalari (kod yozish, hujjat tahlili, moliya modelingi) ancha murakkab.

Xulosa: yangi paradigmaga tayyorgarlik

Nvidia ishlari — bu faqat benchmark rekordi emas. Bu AI agentlarini qurish falsafasining o'zgarishi signalidir. Kelajakda "qaysi model?" savolidan oldin "qaysi harness?" savoli keladi. Va bu harnessni o'ziz qurishingiz, moslashtirishingiz va boshqarishingiz mumkin. Bu — kuch foydalanuvchining qolg'a o'tishi.

Texnologiya rahbarlari va dasturchilar uchun xabar aniq: model tanlovi ustida ko'p vaqt sarflamang. Harness arxitekturasiga e'tibor bering. Chunki aynan u 'aqlli' modelni haqiqiy 'agent'ga aylantiradi.

Manba: TechCrunch
#Nvidia #AI agents #harness #Claude Opus 5 #ARC-AGI-3
Telegram da muhokama qilish