إخفاقات لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↑.
النماذج المعروضة
15
إجمالي الإخفاقات
386
النموذج الأكثر تأثرًا
Nemotron 3 Nano Omni 30b A3b Reasoning 2
215/215
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #38 | Muse Spark 1.1 medium | Meta | 2 | 8.6 | $1.420 | 15/22 | 26.2s |
| #36 | Muse Spark 1.2 high | Meta | 3 | 8.7 | $1.771 | 14/22 | 26.6s |
| #97 | GPT-5.4 Mini medium | OpenAI | 3 | 7.5 | $0.786 | 12/22 | 26.7s |
| #57 | GPT-5 Mini medium | OpenAI | 3 | 8.1 | $0.241 | 12/22 | 27.6s |
| #109 | GLM 5.3 high | Z.ai | 1 | 7.3 | $0.403 | 13/22 | 27.8s |
| #47 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $1.182 | 14/22 | 28.5s |
| #300 | Grok Build 0.1 none | X AI | 2 | 4.0 | $0.547 | 7/19 | 28.7s |
| #258 | North Mini Code none | Cohere | 2 | 5.1 | $0.000 | 4/22 | 29.9s |
| #50 | Inkling Small high | Thinkingmachines | 2 | 8.4 | $0.398 | 14/22 | 30.4s |
| #121 | Muse Glimmer 30B medium | Meta | 1 | 7.2 | $0.227 | 11/22 | 30.6s |
| #82 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $2.961 | 13/22 | 32.2s |
| #132 | Grok 4.20 medium | X AI | 2 | 7.0 | $0.805 | 11/22 | 32.6s |
| #76 | Qwen3.8 27B medium | Qwen | 2 | 7.8 | ~$0.058 | 14/22 | 33.0s |
| #80 | GLM 5 medium | Z.ai | 1 | 7.7 | $0.228 | 15/21 | 33.5s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 1 | 5.4 | $0.037 | 4/22 | 36.2s |