Sun'iy intellekt

Gemini videoni tushunish qobiliyatini 'agentik' darajaga ko'tardi: 88% token tejamkorligi va subsoniya aniqlik

2-sentabr, 2026, 10:385 ko'rish7 daqiqa o'qish
Gemini videoni tushunish qobiliyatini 'agentik' darajaga ko'tardi: 88% token tejamkorligi va subsoniya aniqlik

Google o'zining Gemini AI modeli oilasiga "agentik video tushunish" (agentic video understanding) degan yangi fundamental qobiliyatni kiritdi. Bu faqat "video tahlili" funksiyasining keyingi versiyasi emas — model videoni passiv tomosha qilmas, balki unda sodir bo'votgan voqealarni aktiv tarzda tahlil qilishi, ob'ektlarni kuzatishi va mantiqiy xulosalar yasashi imkonini beradi. Yangilik Gemini 3.7 Flash, 3.6 Flash va 3.5 Flash-Lite — yani eng so'nggi uchta "Flash" oila modelida darhol faol.

Nima o'zgarib qoldi: passive tahlildan agentik harakatga

Avvalgi versiyalarda Gemini videoni bir necha kadr (frame) yarimasi sifatida qabul qilib, ularni tasvirlab berardi: "Videoda odam yurib bormoqda, orqa fonda mashina o'tmoqda." Endi model vaqt o'lchovini subsoniya (sub-second) darajasiga yetkazib, har bir ob'ektning harakat yo'nalishini, tezlanishini va o'zaro o'zaro ta'sirini kuzatib bora oladi. Masalan, "3-soniyada chap tomondan kelayotgan qizil sedan 45 km/soat tezlikda o'tib, 7-soniyada o'ngga burilib ketdi" degan darajada aniq tavsif berishi mumkin.

agentic video understanding gemini image 1

Bu "agentik" atamasi tasodifiy emas. Model videoni faqat "ko'rmaydi", balki unda vazifa bajaradi: ob'ektlarni sanash, yo'nalishni qayd etish, pattern (naqsh) aniqlash va hatto "nima sodir bo'lishi mumkin" deb bashorat qilish. Bu — ko'rinish (vision) va mantiq (reasoning) o'rtasidagi chekkanni yuvib yuborish.

Uchta model, bitta arxitektura: nima uchun Flash oilasi?

Google eng katta model (Ultra/Pro) emas, balki tezlik va samaradorlik uchun mo'ljallangan Flash oilasiga bu qobiliyatni berdi. Bu strategik tanlov:

  • Gemini 3.7 Flash — hozirgi eng kuchli Flash model, murakkab vazifalar uchun.
  • Gemini 3.6 Flash — oldingi avlod, hali ham keng tarqalgan.
  • Gemini 3.5 Flash-Lite — eng yengil, past resurs talab qiluvchi versiya.

Uch modelga ham bir xil qobiliyat kiritilganligi — bu ekosistema yagona standart yaratish harakati. Dasturchilar model o'zgartirganda video tahlil logikasini qayta yozmasliklari kerak. Bu Google ning "model oila sifatida fikrlash" strategiyasining bir qismi.

Raqamlar oldida: 88% token tejamkorligi nima anglatadi?

Eng kichik model (Flash-Lite) hamda eng kattasi (3.7 Flash) uchun token sarfi 88% ga qoldirildi. Amalda bu nima degani? Agar oldin 10 minutlik videoni tahlil qilish 500 000 token sarflatsa, hozir u 60 000 token ga yaqin. Bu — narx 8-9 marta tushishi va kontekst oynasi (context window) bo'sh qolishi, yani bir sessiyada ko'proq video qayta ishlash imkoniyati.

Bunda 7% aniqlik oshishi ham qo'shilgan. Bu kichik ko'rinishi mumkin, lekin subsoniya vaqt belgilash va ob'ekt sanash kabi vazifalarda 7% — bu yuzlab xato tasdiqlashdan xalos bo'lish degani. Maxsus maxsus: ob'ekt sanash (object counting) va harakat yo'nalishi (trajectory tracking) metrikalarida oshish ko'proq his qilinadi.

Qanday ishlaydi: texnik ortqa fon (qisqacha)

Google rasmiy blogida to'liq arxitektura ochilmagan, lekin mavjud ma'lumotlardan quyidagilarni ajratib olish mumkin:

  • Kadr tanlash (frame sampling) — model har bir kadrni emas, balki strategik nuqtalardagi kadrlarni tanlaydi (keyframe detection). Bu token tejashning asosiy mexanizmi.
  • Vaqt kodlash (temporal encoding) — har bir tanlangan kadrga subsoniya aniqlikda vaqt belgisi (timestamp) biriktiriladi.
  • Ob'ekt doimiy identifikatori (persistent object IDs) — bir ob'ekt kadrlar o'rtasida o'tganda, model uni "yangi ob'ekt" deb his qilmaydi, balki ID ni saqlab turadi. Bu sanash va yo'nalish kuzatish uchun kritikal.
  • Mantiqiy tahlil qatlami — vizual ma'lumotlar ustida kichik lekin murakkab reasoning (o'ylash) qatlami ishlaydi: "Bu ob'ekt to'xtadi, keyin o'ngga burildi, demak bu — parkovka manevri."

Bu yondashuv Video-LLaMA, VideoChat kabi oldingi ochiq modellardan farq qiladi: ular odatda barcha kadrlarni enkoderni o'tkazib, keyin LLM ga yuborardi — bu token patlayishiga olib kelardi. Google ning "seçkili kadr + vaqt kodlash + ob'ekt ID" formulasi samaradorlikka yo'l qo'ydi.

Raqobatchilar bilan taqqoslash: nima yangi?

OpenAI ning GPT-4o (omni) ham video qabul qiladi, lekin u real-time streaming (onlayn efir) uchun mo'ljallangan. Anthropic ning Claude 3.5 Sonnet ham video tahlil qiladi, lekin token sarfi yuqori va subsoniya vaqt belgilash emas, balki kadr darajasida ishlaydi. Google ning yondashuvi — asinxron, yuklab olingan video fayllari uchun optimallashtirilgan va token tejamkorligi ustuvorligi. Bu — video arxivlari, xavfsizlik kameralari, sport tahlili, ta'lim materiallari kabi katta hajmdagi yozma videolar bilan ishlash uchun mo'ljallangan.

Yana bir nuans: Google Vertex AI va AI Studio orqali API sifatida ham bu qobiliyatni taqdim etadi. Demak, korporativ mijozlar o'z ilovalariga (masalan, qurilish ob'ekti kuzatuv tizimi, savdo do'konlari trafik tahlili) bu modulni integratsiya qila oladilar.

gemini agentic video understanding image 2

Cheklovlar va ochiq savollar

Har qanday yangi texnologiya kabi, shu yerda ham e'tibor talab qiluvchi nuanslar bor:

  • Maximal video davomiyligi rasmiy e'lonlarda aniq ko'rsatilmagan. Flash modellarning kontekst oynasi 1 mln token gacha, lekin video tokenlari to'g'ri hisoblansa, bu taxminan 2-3 soatlik 1080p videoga yetarli. 4K va 60fps videolar uchun hajm ko'payadi.
  • Yuz tanish (face recognition) va shaxsiy ma'lumotlar siyosati: Google avvaldan "yuz tanish emas, yuz aniqlash (face detection)" degan pozitsiyasida. Agentik tahlil shaxsni kuzatib borsa ham, uning kimligi aniqlanmaydi — bu maxfiylik uchun yaxshiroq, lekin ba'zi korporativ scenariylarda cheklov tug'diradi.
  • Ovoz (audio) tahlili — hozircha video vizual qismi uchun. Ovozli izoh, nutq tanib olish (ASR) alohida modul kerak. Kelajakda multimodal birlashtirish kutiladi.
  • Haqeeqi vaqt (real-time) rejimi — bu funksiya streaming (onlayn kamera efiri) uchun emas. Agar siz "hozir nima bo'vayotganini" kuzatmoqchi bo'lsangiz, GPT-4o Realtime API yoki Google o'zi ning Live API variantlari mos keladi.

Kimga va qanday foyda yetkazadi?

Dasturchilar uchun: Video tahlil modullarini o'zimiz yozish/orqali o'tkazish shart emas. API chaqiruvi — va sizda strukturlangan JSON natija: ob'ektlar ro'yxati, vaqt belgilari, harakat vektorlari, xulosa.

Media va kontent yaratchilar uchun: 10 soatlik suyuqlikdan avtomatik "eng qiziq 3 daqiqa" kesib olish, teglash, qidiruv indekslash — endi token narxi oldincha emas.

Xavfsizlik va logistika uchun: Kameradan kelayotgan yozuvlarni avtomatik audit qilish: "Kamyon 03:14:22 da yukni tushirdi, 03:18:05 da yuklab yola chiqdi" — bu endi odam operatorisiz, 24/7 ishlaydi.

Ta'lim va tadqiqot uchun: Ilmiy tajriba videolari, darsliklar, tibbiy operatsiya yozuvlari — ularning avtomatik strukturlashtirilishi va qidiruvga tayyorlanishi.

Google ning katta o'yini: ekosistema qulayligi

Bu e'lon izolyatsiyada emas. Oxirgi oylarda Google: Gemini 3.7 Flash ni chiqardi, mobile uchun "Spark" chat va vazifa biriktirish funksiyalarini test qildi, va endi — agentik video. Bu — model, vosita, platforma uchburchagini to'ldirish harakati. Maqsad: dasturchi "qaysi model?" deb o'ylamasin, balki "qanday vazifa?" deb so'rasin, va Google tizimi o'zi eng mos keluvchini tanlab bersin.

Token tejamkorligi 88% — bu faqat pul tejash emas. Bu kengroq kontekst oynasi degani: bir so'rovda bir necha videoni solishtirish, ularning o'rtasidagi farqni topish, vaqat ketma-ketligida o'zgarishlarni kuzatish imkoniyati. Masalan, "Ushbu uchta kunlik xavfsizlik kamerasi yozuvidan faqat odam paydo bo'lgan segmentlarni ajratib ber" — bu endi bitta so'rovda bajarilishi mumkin.

Yakun: videoni "ko'rish"dan "tushunish"ga o'tish

Agentik video tushunish — bu computer vision (kompyuter ko'rish) va LLM reasoning (kattal til modeli mantiqi) o'rtasidagi oxirgi devorning yiqilishi. Google buni eng katta modeliga emas, balki eng keng tarqalgan, eng arzon va eng tez Flash oilasiga berdi. Bu — demokratlashtirish harakati.

Kelajagi qisqada: video — bu faqat piksel to'plami emas, bu vaqtda kodlangan ma'lumot. Va endi bu ma'lumotni o'qish, strukturlash va ishlatish — token narxi 9 marta arzon, aniqlik 7% yuqori, va subsoniya vaqt belgilash bilan amalga oshiriladi. Dasturchilar uchun — bu yangi API endpoint. Foydalanuvchilar uchun — bu "videoni qidirish" degan yangi paradigma. Google uchun — bu AI asistentini "ko'zlari bor" holatga keltirishning keyingi bosqichi.

Manba: Android Authority
#Gemini #Google AI #video understanding #multimodal AI #Flash models
Telegram da muhokama qilish