حل الألغاز: لم يتبع التعليمات
حل الألغاز
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في حل الألغاز، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: عدد الإخفاقات ↑.
أسباب الفشل
121/121
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #25 | GPT-5.3-Codex medium | OpenAI | 1 | 9.0 | $0.988 | 2/3 | 5.05s |
| #26 | Muse Spark 1.3 high | Meta | 1 | 8.7 | $1.653 | 2/3 | 38.4s |
| #34 | GLM 5.3 Flash max | Z.ai | 1 | 8.7 | $0.059 | 2/3 | 5.61s |
| #36 | Muse Spark 1.2 high | Meta | 1 | 8.2 | $1.771 | 2/3 | 10.1s |
| #37 | Muse Spark 1.2 medium | Meta | 1 | 8.7 | $1.339 | 2/3 | 9.45s |
| #38 | Muse Spark 1.1 medium | Meta | 1 | 7.9 | $1.420 | 2/3 | 42.5s |
| #42 | GPT-5.4 medium | OpenAI | 1 | 8.2 | $1.560 | 2/3 | 9.14s |
| #44 | Muse Spark 1.2 low | Meta | 1 | 8.7 | $0.655 | 2/3 | 5.17s |
| #45 | Grok 4.6 medium | X AI | 1 | 8.7 | $1.713 | 2/3 | 16.3s |
| #47 | GPT-5.2 medium | OpenAI | 1 | 7.5 | $1.182 | 2/3 | 5.80s |
| #50 | Inkling Small high | Thinkingmachines | 1 | 4.8 | $0.398 | 0/3 | 14.4s |
| #51 | Muse Spark 1.1 low | Meta | 1 | 8.3 | $0.673 | 2/3 | 6.60s |
| #54 | Muse Spark 1.3 low | Meta | 1 | 8.2 | $0.689 | 2/3 | 11.3s |
| #57 | GPT-5 Mini medium | OpenAI | 1 | 5.6 | $0.241 | 1/3 | 15.2s |
| #59 | Inkling high | Thinkingmachines | 1 | 6.9 | $1.046 | 1/3 | 10.7s |