Claude Fable 5.1, Anthropicning yangi AI modeli, kodlash, bilimli ish va uzun muddatli muammolarni yechish sohasida yangi standartni o‘rnatishini e’lon qilgan. uning e’lonida Terminal‑Bench‑Science 0.1 benchmarkida 52,6 % ball topilgani ko‘rsatilgan, bu Fable 5‑ning 24,7 % dan, Opus 5‑ning 29,0 % dan va GPT‑5.6 Sol‑ning 22,4 % dan oshiq. Boshqa testlarda ham yanada kuchli natijalar ko‘rsatildi, lekin ilmiy sohada ko‘rsatilgan oshish eng ahamiyatli.
Pelikan benchmark nima?
Pelikan benchmarki — bu modelga "Generate an SVG of a pelican riding a bicycle" buyrug‘ini berish va natijada chiqqan SVG kodining sifatini baholash usuli. Shu buyruq oddiy tasvir yaratishni talab qilmasdan, modelning tasvirni tasvirlash, elementlarni joylashtirish, animatsiya uchun lozim bo‘lgan detalni o‘ylash qobiliyatini tekshiradi. 2025‑yilda bu test modelning umumiy qo‘llab‑quvvatlash darajasini aniqlashda yaxshi korrelatsiya ko‘rsatgan, lekin 2026‑yilga qaraganda u model ichidagi reasoning darajalari bilan bog‘liq taqqoslashga daha muvofiq bo‘ldi.
Reasoning darajalari va ularning ta’siri
Claude Fable 5.1 da reasoning (sebab‑so‘bab tushunish) darajasi quyidagicha: low, medium, high, xhigh va max. Reasoningni o‘chirish imkoni yo‘q, shuning uchun har bir darajada model bir necha sekund yoki daqiqaga qadar “fikir” qiladi va undan natija tokenlar hosil qiladi. Bu holatda token soni, ishlash vaqti va xarajat directly reasoning darajasiga bog‘liq.
Birinchi urinishlarda low va medium darajalarida model hech qanday reasoning matnini ko‘rsatmadi, chiqishi 1 998 va 1 977 token bo‘ldi, vaqt 23,8 s va 23,0 s, xarajat 10,017 cent va 9,912 cent. Bu esa low va medium darajalarida modelning ushbu buyruq uchun reasoningni o‘tkazmadi, balki oldin o‘rganilgan kalitlarni ishlatishini ko‘rsatadi.
High darajasi
High darajasida model 29,6 sekund davomida 2 612 token chiqardi, xarajat 13,087 cent. Reasoning matni quyidagicha: “Men pelikan va velosiped uchun joylashuv rejalashtiryapman, osmon yeri, ikki liplik gulchaga ega gulchak, ramka, o‘rn va dirg‘ah, oq jismli pelikan, uzun bo‘yi va pomeranz rangli qo‘ziq.” Bu matn low/medium dan farq qiladigan ko‘proq detal beradi, lekin hali ham sodda tasvirga yaqin.
Extra high (xhigh) darajasi
Xhigh darajasida model 7 minut 51 sekund (471 s) davomida 36 767 token chiqardi, xarajat $1,83. Reasoning trace uzunroq bo‘ldi va quyidagilarni o‘rganadi: go‘z qo‘shish, kanatlarni dirg‘ah gacha yechish, pomeranz rangli ayoqlarni pedallarga yetkazish, kichik duyma mayisasi, pelikanni velosipeddan katta qilib ko‘rsatish (komik effekt). Model bu detalni “charmant” deb hisobladi, over‑engineering emas.
Max darajasi
Max darajasi eng uzun va costly variant bo‘ladi: 13 minut 54 sekund (834 s), 65 927 token, xarajat $3,30. Reasoning trace daqiq va yaratik: pedal shakllari, ayoqlarning joylashuvi, qanot dirg‘ah bilan bog‘liq, pelikan uchun moviza rangli shlyapa, balikli savat. Model qo‘shimcha elementlar (chalpa, kask) haqida tartiblashadi, lekin ularni joylashuvi, to‘g‘ri burchak, chiziq chiziqlari va detalni tarkibiy ravishda tahlil qiladi. Natijada chiqqan SVG pelikan velosipedda chukur rangli fon, to‘g‘ri joylashgan ayoqlar, qanot dirg‘ah bilan bog‘liq, shlyapa va savat bilan birga.
Animatsiya urinishi
Hacker News‑dagi izohchi animatsiya so‘rashdi. Autor $3 xarajatni takrorlamoqchi emas, shuning uchun max pelikan SVG‑ni high reasoning darajasiga yubordi: llm logs -cx | llm -m claude-fable-5.1 -s 'animate this'. Natija 6 121 kirish token, 26 201 chiqish token, xarajat $1,37. Animatsiyada gulchaklar noto‘g‘ri yo‘nalishda aylanadi, lekin bu MP4 ga o‘g‘rilash artifacti, asl SVG‑da to‘g‘ri yo‘nalish.
Taqqoslash va tahlil
Pelikan benchmarki modelning umumiy qo‘llab‑quvvatlashini aniqlashda 2025‑yilda yanada ishonchli bo‘lgandi, lekin 2026‑yilga qaraganda u model ichidagi reasoning darajalari bilan bog‘liq taqqoslashga daha muvofiq. Low va medium darajalarida reasoningni o‘tkazmasi modelning ushbu buyruq uchun oldin o‘rganilgan kalitlarni ishlatishini ko‘rsatadi. High darajasida bir qancha planning qo‘shiladi, lekin hali ham sodda. Xhigh va max darajalari esa modelga chuqur planlash, detalni o‘ylash va tasvirni kompozitsiya qilish imkonini beradi, lekin bu esa vaqt va xarajatni oshiradi.
Natijada, Claude Fable 5.1 max darajasida pelikan SVG‑ni aniq, detalga ega va kompozitsiya vaqti bilan yaratishi mumkin, lekin bu xizmat $3,30 xarajat talab qiladi. Low/medium darajalarida tez va arzon lekin detalga ega emas. Shunday qilib, foydalanuvchilar vazifalarining murakkabligi va xarajat chegarasi asosida reasoning darajasini tanlashlari kerak.
Cheklovlar va kelajak
Birinchi, pelikan benchmarki faqat SVG tasvir yaratishni tekshiradi, bu modelning kodlash, ma’lumotlar tahlili yoki muammolarni yechish qobiliyatini to‘liq ifodalaymaydi. Ikkinchi, reasoning darajalari token sarflashini oshiradi, bu katta hajmli ilovalar uchun ekonomik emas bo‘lishi mumkin. Uchinchi, animatsiya MP4 ga o‘g‘rilashida noto‘g‘ri yo‘nalish artifacti paydo bo‘ladi, bu modelning asl SVG‑da to‘g‘ri bo‘lganini ko‘rsatadi.
Kelajakda, model arxitekturasi reasoningni samaraliroq bosqichga bo‘lishi, tokenni kamaytirish va animatsiya formatlarini to‘g‘ri ishlashni ta’minlash mumkin. shuningdek, pelikan benchmarkiga qo‘shimcha vazifalar (masalan, interaktiv grafik, kodlash vazifalari) qo‘shilganda modelning universal qo‘llab‑quvvatlashini aniqlashga yordam beradi.
llm logs -cx | llm -m claude-fable-5.1 -s 'animate this'
Xulosa
Claude Fable 5.1 modeli pelikan SVG tasvirini yaratishda reasoning darajalari asosida zauqali natijalar beradi: low/medium – tez va arzon lekin detalga ega emas; high – bir qancha planning; xhigh va max – chuqur detal, kompozitsiya va animatsiya imkoniyati, lekin yuqori xarajat va vaqt talab qiladi. Bu natijalar modelning tushunish va yaratish qobiliyatini aniqlashda reasoning darajalari roli ko‘rsatadi, foydalanuvchilarga vazifalarining murakkabligi va resurs chegarasi asosida tanlash imkonini beradi.
Asl manba: simonwillison.net