Claude Fable 5.1 modeli pelikan SVG tasvirini qanday yaratadi?
Claude Fable 5.1 modelining pelikan SVG tasvirini yaratish tajribasi, reasoning darajalari, token sarflash va natijalar tahlili.

Google o'zining Gemini AI modeli oilasiga "agentik video tushunish" (agentic video understanding) degan yangi fundamental qobiliyatni kiritdi. Bu faqat "video tahlili" funksiyasining keyingi versiyasi emas — model videoni passiv tomosha qilmas, balki unda sodir bo'votgan voqealarni aktiv tarzda tahlil qilishi, ob'ektlarni kuzatishi va mantiqiy xulosalar yasashi imkonini beradi. Yangilik Gemini 3.7 Flash, 3.6 Flash va 3.5 Flash-Lite — yani eng so'nggi uchta "Flash" oila modelida darhol faol.
Avvalgi versiyalarda Gemini videoni bir necha kadr (frame) yarimasi sifatida qabul qilib, ularni tasvirlab berardi: "Videoda odam yurib bormoqda, orqa fonda mashina o'tmoqda." Endi model vaqt o'lchovini subsoniya (sub-second) darajasiga yetkazib, har bir ob'ektning harakat yo'nalishini, tezlanishini va o'zaro o'zaro ta'sirini kuzatib bora oladi. Masalan, "3-soniyada chap tomondan kelayotgan qizil sedan 45 km/soat tezlikda o'tib, 7-soniyada o'ngga burilib ketdi" degan darajada aniq tavsif berishi mumkin.
Bu "agentik" atamasi tasodifiy emas. Model videoni faqat "ko'rmaydi", balki unda vazifa bajaradi: ob'ektlarni sanash, yo'nalishni qayd etish, pattern (naqsh) aniqlash va hatto "nima sodir bo'lishi mumkin" deb bashorat qilish. Bu — ko'rinish (vision) va mantiq (reasoning) o'rtasidagi chekkanni yuvib yuborish.
Google eng katta model (Ultra/Pro) emas, balki tezlik va samaradorlik uchun mo'ljallangan Flash oilasiga bu qobiliyatni berdi. Bu strategik tanlov:
Uch modelga ham bir xil qobiliyat kiritilganligi — bu ekosistema yagona standart yaratish harakati. Dasturchilar model o'zgartirganda video tahlil logikasini qayta yozmasliklari kerak. Bu Google ning "model oila sifatida fikrlash" strategiyasining bir qismi.
Eng kichik model (Flash-Lite) hamda eng kattasi (3.7 Flash) uchun token sarfi 88% ga qoldirildi. Amalda bu nima degani? Agar oldin 10 minutlik videoni tahlil qilish 500 000 token sarflatsa, hozir u 60 000 token ga yaqin. Bu — narx 8-9 marta tushishi va kontekst oynasi (context window) bo'sh qolishi, yani bir sessiyada ko'proq video qayta ishlash imkoniyati.
Bunda 7% aniqlik oshishi ham qo'shilgan. Bu kichik ko'rinishi mumkin, lekin subsoniya vaqt belgilash va ob'ekt sanash kabi vazifalarda 7% — bu yuzlab xato tasdiqlashdan xalos bo'lish degani. Maxsus maxsus: ob'ekt sanash (object counting) va harakat yo'nalishi (trajectory tracking) metrikalarida oshish ko'proq his qilinadi.
Google rasmiy blogida to'liq arxitektura ochilmagan, lekin mavjud ma'lumotlardan quyidagilarni ajratib olish mumkin:
Bu yondashuv Video-LLaMA, VideoChat kabi oldingi ochiq modellardan farq qiladi: ular odatda barcha kadrlarni enkoderni o'tkazib, keyin LLM ga yuborardi — bu token patlayishiga olib kelardi. Google ning "seçkili kadr + vaqt kodlash + ob'ekt ID" formulasi samaradorlikka yo'l qo'ydi.
OpenAI ning GPT-4o (omni) ham video qabul qiladi, lekin u real-time streaming (onlayn efir) uchun mo'ljallangan. Anthropic ning Claude 3.5 Sonnet ham video tahlil qiladi, lekin token sarfi yuqori va subsoniya vaqt belgilash emas, balki kadr darajasida ishlaydi. Google ning yondashuvi — asinxron, yuklab olingan video fayllari uchun optimallashtirilgan va token tejamkorligi ustuvorligi. Bu — video arxivlari, xavfsizlik kameralari, sport tahlili, ta'lim materiallari kabi katta hajmdagi yozma videolar bilan ishlash uchun mo'ljallangan.
Yana bir nuans: Google Vertex AI va AI Studio orqali API sifatida ham bu qobiliyatni taqdim etadi. Demak, korporativ mijozlar o'z ilovalariga (masalan, qurilish ob'ekti kuzatuv tizimi, savdo do'konlari trafik tahlili) bu modulni integratsiya qila oladilar.
Har qanday yangi texnologiya kabi, shu yerda ham e'tibor talab qiluvchi nuanslar bor:
Dasturchilar uchun: Video tahlil modullarini o'zimiz yozish/orqali o'tkazish shart emas. API chaqiruvi — va sizda strukturlangan JSON natija: ob'ektlar ro'yxati, vaqt belgilari, harakat vektorlari, xulosa.
Media va kontent yaratchilar uchun: 10 soatlik suyuqlikdan avtomatik "eng qiziq 3 daqiqa" kesib olish, teglash, qidiruv indekslash — endi token narxi oldincha emas.
Xavfsizlik va logistika uchun: Kameradan kelayotgan yozuvlarni avtomatik audit qilish: "Kamyon 03:14:22 da yukni tushirdi, 03:18:05 da yuklab yola chiqdi" — bu endi odam operatorisiz, 24/7 ishlaydi.
Ta'lim va tadqiqot uchun: Ilmiy tajriba videolari, darsliklar, tibbiy operatsiya yozuvlari — ularning avtomatik strukturlashtirilishi va qidiruvga tayyorlanishi.
Bu e'lon izolyatsiyada emas. Oxirgi oylarda Google: Gemini 3.7 Flash ni chiqardi, mobile uchun "Spark" chat va vazifa biriktirish funksiyalarini test qildi, va endi — agentik video. Bu — model, vosita, platforma uchburchagini to'ldirish harakati. Maqsad: dasturchi "qaysi model?" deb o'ylamasin, balki "qanday vazifa?" deb so'rasin, va Google tizimi o'zi eng mos keluvchini tanlab bersin.
Token tejamkorligi 88% — bu faqat pul tejash emas. Bu kengroq kontekst oynasi degani: bir so'rovda bir necha videoni solishtirish, ularning o'rtasidagi farqni topish, vaqat ketma-ketligida o'zgarishlarni kuzatish imkoniyati. Masalan, "Ushbu uchta kunlik xavfsizlik kamerasi yozuvidan faqat odam paydo bo'lgan segmentlarni ajratib ber" — bu endi bitta so'rovda bajarilishi mumkin.
Agentik video tushunish — bu computer vision (kompyuter ko'rish) va LLM reasoning (kattal til modeli mantiqi) o'rtasidagi oxirgi devorning yiqilishi. Google buni eng katta modeliga emas, balki eng keng tarqalgan, eng arzon va eng tez Flash oilasiga berdi. Bu — demokratlashtirish harakati.
Kelajagi qisqada: video — bu faqat piksel to'plami emas, bu vaqtda kodlangan ma'lumot. Va endi bu ma'lumotni o'qish, strukturlash va ishlatish — token narxi 9 marta arzon, aniqlik 7% yuqori, va subsoniya vaqt belgilash bilan amalga oshiriladi. Dasturchilar uchun — bu yangi API endpoint. Foydalanuvchilar uchun — bu "videoni qidirish" degan yangi paradigma. Google uchun — bu AI asistentini "ko'zlari bor" holatga keltirishning keyingi bosqichi.