Interaktiv AI Red Teaming Studio (studio/index.html) muhitida FGSM gradient shovqini bilan avtopilot ko'rishini aldash, Adversarial Training orqali modelni mustahkamlash, hamda NeMo Guardrails (Regex, Shannon Entropiya, Canary Trap) to'siqlarini sinash.
| Amaliy Kvest (Studio) | Harakat / Hujum Turi | Kutilgan Natija (Status) | Ball va Holat |
|---|---|---|---|
| 1. FGSM Aldovi (Stop -> 80) | `Epsilon (ε) > 0.030 ga surish` | Neyron tarmoq STOP ni Tezlik 80 km/h deb xato o'qiydi | 2 ball / [ ] |
| 2. Adversarial Training Himoyasi | `Adversarial Training toggle ni yoqish` | Qayta o'qitilgan model STOP belgisini 90%+ aniqlikda taniydi | 3 ball / [ ] |
| 3. Jailbreak va Guardrails Testi | `Direct DAN yoki Base64 hujumi` | Regex yoki Entropiya filtri hujumni darhol bloklaydi | 3 ball / [ ] |
| 4. Canary Trap Bilan Context Leak | `Ssenariy hiylasi bilan kalitni so'rash` | Output Guardrail CANARY_SEC_TARGET_99 sizishini to'xtatadi | 2 ball / [ ] |
1. Nega Katta Til Modellarida (LLM) tizimli buyruqlar (System Prompt) va foydalanuvchi xabari bitta tokenda kelishi arxitekturaviy Prompt Injection zaifligini keltirib chiqaradi?
2. Kanareyka tokenlari (Canary Tokens) nima va ular korporativ AI tizimlarida intellektual mulk hamda maxfiy prompt sizib chiqishini qanday fosh qiladi?