إخفاقات لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↑.
النماذج المعروضة
15
إجمالي الإخفاقات
386
النموذج الأكثر تأثرًا
Nemotron 3 Nano Omni 30b A3b Reasoning 2
215/215
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #59 | Inkling high | Thinkingmachines | 1 | 8.0 | $1.046 | 15/22 | 62.6s |
| #302 | Ling 3.0 Tiny low | Inclusionai | 4 | 3.8 | $0.000 | 4/22 | 66.2s |
| #118 | Muse Glimmer 30B high | Meta | 3 | 7.2 | $0.430 | 10/22 | 66.7s |
| #203 | Dots 3 Note Preview medium | Dots Studio | 2 | 5.9 | $0.000 | 8/22 | 67.1s |
| #171 | Dots 3 Note Preview high | Dots Studio | 1 | 6.4 | $0.000 | 10/22 | 67.8s |
| #305 | Ling 3.0 Tiny medium | Inclusionai | 4 | 3.8 | $0.000 | 4/22 | 68.1s |
| #245 | Gemini 3.1 Flash Lite Preview high | 1 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #128 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.0 | $0.078 | 11/22 | 68.4s |
| #175 | Ring-2.6-1T medium | Inclusionai | 2 | 6.4 | $0.102 | 11/22 | 68.8s |
| #284 | MiniMax M2.5 medium | Minimax | 3 | 4.6 | $0.327 | 5/22 | 69.1s |
| #63 | GLM 5.2 high | Z.ai | 1 | 8.0 | $1.188 | 14/22 | 69.9s |
| #250 | Nemotron 3.5 Lightning medium | NVIDIA | 3 | 5.1 | $0.156 | 5/22 | 70.1s |
| #81 | Seed-2.0-Code low | Bytedance Seed | 1 | 7.7 | $0.767 | 13/22 | 72.2s |
| #24 | Grok 4.5 high | X AI | 1 | 9.0 | $2.252 | 17/22 | 72.3s |
| #45 | Grok 4.6 medium | X AI | 1 | 8.4 | $1.713 | 16/22 | 73.5s |