الذكاء العام: لم يتبع التعليمات
الذكاء العام
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في الذكاء العام، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
78/78
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #142 | Qwen3.5-122B-A10B none | Qwen | 1 | 5.0 | $0.247 | 0/1 | 1.12s |
| #143 | Gemini 3.1 Flash Lite high | 1 | 5.0 | $2.044 | 0/1 | 45.7s | |
| #145 | GLM 5V Turbo none | Z.ai | 1 | 4.6 | $0.052 | 0/1 | 2.22s |
| #146 | Owl Alpha medium | Openrouter | 1 | 4.3 | $0.000 | 0/1 | 58.6s |
| #147 | Mimo V2 PRO none | Xiaomi | 1 | 4.3 | $0.045 | 0/1 | 2.44s |
| #148 | Owl Alpha none | Openrouter | 1 | 4.3 | $0.000 | 0/1 | 4.61s |
| #149 | KAT-Coder-Air V2.5 medium | Kwaipilot | 1 | 5.0 | $0.048 | 0/1 | 9.81s |
| #152 | Qwen3.6 27B none | Qwen | 1 | 5.2 | $0.087 | 0/1 | 1.07s |
| #156 | Gemma 4 26B A4B none | 1 | 4.0 | $0.015 | 0/1 | 3.54s | |
| #158 | KAT-Coder-Air V2.5 low | Kwaipilot | 1 | 5.0 | $0.041 | 0/1 | 10.1s |
| #162 | Ling-2.6-1T none | Inclusionai | 1 | 5.0 | $0.016 | 0/1 | 20.3s |
| #167 | Mistral Small 4 medium | Mistral | 1 | 4.8 | $0.096 | 0/1 | 2.05s |
| #169 | Qwen3.5-9B none | Qwen | 1 | 4.4 | $0.021 | 0/1 | 552ms |
| #170 | GLM 5 Turbo none | Z.ai | 1 | 4.2 | $0.047 | 0/1 | 2.18s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 3.9 | $0.163 | 0/1 | 38.7s |