الذكاء العام: لم يتبع التعليمات
الذكاء العام
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في الذكاء العام، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
115/115
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #259 | MiniMax M2.7 medium | Minimax | 1 | 3.9 | $0.208 | 0/1 | 38.7s |
| #260 | Mercury 2.5 Preview low | Inception | 1 | 5.0 | $0.011 | 0/1 | 1.05s |
| #271 | GPT-5.4 Nano none | OpenAI | 1 | 3.8 | $0.041 | 0/1 | 1.31s |
| #272 | Trinity Large Thinking high | Arcee AI | 1 | 6.5 | $0.592 | 0/1 | 12.9s |
| #273 | Grok 4.20 Multi Agent Beta medium | X AI | 1 | 5.8 | $5.599 | 0/1 | 6.40s |
| #276 | Trinity Large Preview none | Arcee AI | 1 | 4.5 | $0.008 | 0/1 | 873ms |
| #277 | Hunter Alpha medium | OpenRouter | 1 | 7.0 | $0.000 | 0/1 | 6.44s |
| #278 | Grok 4.1 Fast medium | X AI | 1 | 4.2 | $0.069 | 0/1 | 16.2s |
| #280 | Cobuddy medium | Baidu | 1 | 4.2 | $0.000 | 0/1 | 23.2s |
| #281 | Mercury 2 none | Inception | 1 | 4.8 | $0.030 | 0/1 | 628ms |
| #283 | Qwen3 Coder Next medium | Qwen | 1 | 6.3 | $0.034 | 0/1 | 1.39s |
| #284 | MiniMax M2.5 medium | Minimax | 1 | 3.8 | $0.327 | 0/1 | 6.63s |
| #286 | Grok 4.20 Beta none | X AI | 1 | 5.0 | $0.087 | 0/1 | 541ms |
| #288 | Elephant Alpha none | Openrouter | 1 | 4.0 | $0.000 | 0/1 | 854ms |
| #290 | Elephant Alpha medium | Openrouter | 1 | 4.3 | $0.000 | 0/1 | 920ms |