إخفاقات لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↓.
215/215
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #188 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.11s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.92s |
| #158 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #292 | Hunter Alpha none | OpenRouter | 2 | 4.2 | $0.000 | 6/18 | 4.70s |
| #255 | MiMo-V2.5 none | Xiaomi | 1 | 5.1 | $0.025 | 5/22 | 4.68s |
| #100 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.4 | $0.117 | 14/22 | 4.59s | |
| #112 | Gemini 3.1 Flash Lite medium | 1 | 7.3 | $0.120 | 13/22 | 4.38s | |
| #237 | MiMo-V2.5-Pro none | Xiaomi | 4 | 5.4 | $0.068 | 5/22 | 4.24s |
| #163 | Mercury 2.5 Preview high | Inception | 2 | 6.6 | $0.030 | 12/22 | 4.01s |
| #193 | Nemotron 3 Ultra none | NVIDIA | 1 | 6.1 | $0.084 | 8/22 | 3.88s |
| #190 | Qwen3.6 Flash none | Qwen | 1 | 6.1 | $0.062 | 7/22 | 3.73s |
| #96 | Mercury 2.5 Preview medium | Inception | 1 | 7.5 | $0.024 | 15/22 | 3.58s |
| #215 | Ling-3.0-flash none | Inclusionai | 1 | 5.7 | $0.004 | 6/22 | 3.56s |
| #247 | Dots 3 Note Preview none | Dots Studio | 2 | 5.2 | $0.000 | 3/22 | 3.53s |
| #265 | Mercury 2.5 Preview none | Inception | 1 | 4.9 | $0.018 | 4/22 | 3.51s |