الذكاء العام: لم يتبع التعليمات
الذكاء العام
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في الذكاء العام، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
78/78
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #12 | Grok 4.5 high | X AI | 1 | 4.7 | $1.707 | 0/1 | 9.82s |
| #13 | GPT-5.3-Codex medium | OpenAI | 1 | 4.6 | $0.920 | 0/1 | 4.87s |
| #18 | GPT-5.4 medium | OpenAI | 1 | 4.7 | $1.533 | 0/1 | 4.92s |
| #21 | GPT-5.2 medium | OpenAI | 1 | 3.7 | $0.951 | 0/1 | 4.32s |
| #23 | Claude Sonnet 5 medium | Anthropic | 1 | 4.8 | $0.922 | 0/1 | 4.32s |
| #25 | Gemini 2.5 Flash medium | 1 | 4.8 | $0.643 | 0/1 | 4.86s | |
| #26 | GPT-5 Mini medium | OpenAI | 1 | 4.5 | $0.237 | 0/1 | 13.5s |
| #30 | GPT-5.2 Chat none | OpenAI | 1 | 4.4 | $0.604 | 0/1 | 3.20s |
| #35 | Seed-2.0-Lite medium | Bytedance Seed | 1 | 6.7 | $0.234 | 0/1 | 18.2s |
| #37 | Qwen3.6 Plus medium | Qwen | 1 | 5.1 | $0.405 | 0/1 | 27.1s |
| #42 | GLM 5 medium | Z.ai | 1 | 6.1 | $0.307 | 0/1 | 14.7s |
| #45 | DeepSeek V4 Flash high | DeepSeek | 1 | 6.1 | $0.042 | 0/1 | 25.2s |
| #47 | MiniMax M3 medium | Minimax | 1 | 5.1 | $0.286 | 0/1 | 33.3s |
| #53 | GPT-5.4 Nano medium | OpenAI | 1 | 4.5 | $0.138 | 0/1 | 4.15s |
| #54 | GPT-5.3 Chat none | OpenAI | 1 | 4.6 | $0.571 | 0/1 | 1.99s |