Kiberxavfsizlik

Ochiq manbalik prompt-injection aniqlovchilarning real AI agent hujumlarini aniqlash qobiliyati

24-sentabr, 2026, 13:190 ko'rish2 daqiqa o'qish
Ochiq manbalik prompt-injection aniqlovchilarning real AI agent hujumlarini aniqlash qobiliyati

Ochiq manbalik prompt-injection aniqlovchilarning real AI agent hujumlarini aniqlash qobiliyati haqidagi yangi tadqiqot natijalarini ommaga taqdim etildi. Tadqiqotda 10 ta ochiq manbalik aniqlovchilarni 629 ta real AgentDojo hujumlariga qarshi sinovdan oʻtkazildi. Natijada, hech biri normal trafikni to'satdan to'xtatmasdan ko'p hujumlarni aniqlay olmadi.

Tadqiqotning maqsadi va usuli

Tadqiqotning maqsadi, ochiq manbalik prompt-injection aniqlovchilarning real AI agent hujumlarini aniqlash qobiliyatini baholash edi. Ushbu aniqlovchilarning qobiliyatini sinovdan oʻtkazish uchun, 629 ta real AgentDojo hujumlari va 97 ta xavfsiz tool outputlari tanlandi. Har bir hujum, agent firewall tomonidan ko'rilganidek, oddiy tool output ichiga joylashtirildi.

Python

Tadqiqotda quyidagi aniqlovchilar ishtirok etdi:

Dataset
  • Jailbreak-detector-large
  • Protectai-deberta-v2
  • Llm-guard
  • Prompt-guard-2-86m
  • Prompt-guard-2-22m
  • Regex-baseline
  • Preamble-defense
  • Testsavant-defender
  • Deepset-deberta
  • Fmops-distilbert

Natijalar

Tadqiqot natijalariga ko'ra, hech biri normal trafikni to'satdan to'xtatmasdan ko'p hujumlarni aniqlay olmadi. Eng yaxshi natijani jailbreak-detector-large aniqlovchisi berdi, u 51% hujumlarni aniqladi, biroq 2% xato musbat natijalar berdi.

Detectors

Meta's Prompt Guard 2 aniqlovchisi esa, faqat 1% hujumlarni aniqladi. Ikki aniqlovchi esa, 98% xavfsiz tool outputlarini ham xato musbat natijalar berdi.

Attacks

Tadqiqot natijalariga ko'ra, aniqlovchilar uch turli usulda xatolarga yo'l qo'yishdi:

Benign
  • Kontekstning aralashtirilishi
  • Matnning tan olinmaganligi
  • Barcha trafikni to'satdan to'xtatish

Cheklovlar va tavsiiyalar

Tadqiqot natijalariga ko'ra, aniqlovchilarning qobiliyati cheklangan. Ular odatda, oddiy so'zlar ichida yashiringan hujumlarni aniqlay olmaydi. Shuning uchun, aniqlovchilarning qobiliyatini oshirish uchun, ular kontekstni va tool calllarning maqsadini hisobga olishlari kerak.

License

Tadqiqot mualliflari, agent firewalllarni qurishda, aniqlovchilarning qobiliyatini oshirish uchun, ularni kontekst va tool calllarning maqsadini hisobga olishlari kerakligini tavsiya qiladilar.

10 prompt-injection detectors vs 629 real agent attacks: none catches most attacks without blocking safe traffic

Tadqiqot natijalarini to'liq o'qish uchun bu havolaga o'ting.

make setup            # 📦 Python 3.12 venv + requirements.txt (agentdojo, transformers, torch, llm-guard)
make bench            # 🧪 16-case built-in sample
make bench-agentdojo  # 📊 the leaderboard above (~25 min on CPU for all 10 detectors)
make bench-payloads   # 🔬 each attack scored on its own (~1 min)
make bench-windows    # 🪟 Prompt Guard 2 input scope × window size (~15 min)

Asl manba: github.com

Manba: Hacker News
#ai #cybersecurity #prompt-injection #agentdojo #open-source
Telegram da muhokama qilish