الذكاء العام: لم يتبع التعليمات
الذكاء العام
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في الذكاء العام، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
78/78
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #180 | GPT-5.4 Nano none | OpenAI | 1 | 3.8 | $0.041 | 0/1 | 1.31s |
| #181 | Grok 4.20 Multi Agent Beta medium | X AI | 1 | 5.8 | $5.599 | 0/1 | 6.40s |
| #183 | Trinity Large Preview none | Arcee AI | 1 | 4.5 | $0.008 | 0/1 | 873ms |
| #184 | Hunter Alpha medium | OpenRouter | 1 | 7.0 | $0.000 | 0/1 | 6.44s |
| #185 | Grok 4.1 Fast medium | X AI | 1 | 4.2 | $0.069 | 0/1 | 16.2s |
| #187 | Qwen3 Coder Next medium | Qwen | 1 | 6.3 | $0.032 | 0/1 | 1.39s |
| #188 | Cobuddy medium | Baidu | 1 | 4.2 | $0.000 | 0/1 | 23.2s |
| #189 | Mercury 2 none | Inception | 1 | 4.8 | $0.030 | 0/1 | 628ms |
| #190 | MiniMax M2.5 medium | Minimax | 1 | 3.8 | $0.340 | 0/1 | 6.63s |
| #191 | Grok 4.20 Beta none | X AI | 1 | 5.0 | $0.087 | 0/1 | 541ms |
| #193 | Elephant Alpha none | Openrouter | 1 | 4.0 | $0.000 | 0/1 | 854ms |
| #195 | Elephant Alpha medium | Openrouter | 1 | 4.3 | $0.000 | 0/1 | 920ms |
| #196 | Hunter Alpha none | OpenRouter | 1 | 6.1 | $0.000 | 0/1 | 2.71s |
| #199 | Hy3 preview none | Tencent | 1 | 4.1 | $0.003 | 0/1 | 16.1s |
| #200 | MiMo-V2-Flash none | Xiaomi | 1 | 4.6 | $0.025 | 0/1 | 1.67s |