إخفاقات لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↑.
النماذج المعروضة
15
إجمالي الإخفاقات
386
النموذج الأكثر تأثرًا
Nemotron 3 Nano Omni 30b A3b Reasoning 2
215/215
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #303 | Grok 4.1 Fast none | X AI | 3 | 3.8 | $0.008 | 3/19 | 1.62s |
| #197 | GPT-5.6 Terra none | OpenAI | 1 | 6.0 | $0.280 | 8/22 | 1.66s |
| #186 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #182 | Gemini 3.1 Flash Lite minimal | 3 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #263 | GPT-4o-mini none | OpenAI | 1 | 5.0 | $0.010 | 5/22 | 1.92s |
| #214 | Inkling Small low | Thinkingmachines | 2 | 5.7 | $0.055 | 9/22 | 2.07s |
| #209 | GPT-5.4 none | OpenAI | 1 | 5.8 | $0.397 | 7/22 | 2.08s |
| #127 | GPT-5.6 Sol none | OpenAI | 1 | 7.0 | $0.201 | 12/22 | 2.17s |
| #224 | Mimo V2 PRO none | Xiaomi | 2 | 5.6 | $0.045 | 7/21 | 2.27s |
| #232 | Mimo V2 Omni none | Xiaomi | 1 | 5.5 | $0.021 | 8/21 | 2.44s |
| #157 | Gemini 3.5 Flash Lite low | 1 | 6.6 | $0.138 | 12/22 | 2.56s | |
| #271 | GPT-5.4 Nano none | OpenAI | 2 | 4.8 | $0.041 | 4/22 | 2.56s |
| #153 | Gemini 3.5 Flash minimal | 1 | 6.7 | $0.300 | 13/22 | 2.65s | |
| #296 | MiMo-V2-Flash none | Xiaomi | 2 | 4.0 | $0.025 | 4/21 | 2.76s |
| #257 | GLM 5 Turbo none | Z.ai | 2 | 5.1 | $0.047 | 6/21 | 2.82s |