حل الألغاز: لم يتبع التعليمات
حل الألغاز
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في حل الألغاز، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
121/121
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #85 | GLM 5 Turbo medium | Z.ai | 1 | 8.7 | $0.323 | 2/3 | 5.23s |
| #87 | Solar Pro 4 xhigh | Upstage | 1 | 8.9 | $0.050 | 2/3 | 58.0s |
| #90 | GPT-5.4 Nano medium | OpenAI | 1 | 4.1 | $0.142 | 0/3 | 3.79s |
| #95 | Qwen3.5-27B medium | Qwen | 1 | 8.2 | $0.982 | 2/3 | 59.6s |
| #97 | GPT-5.4 Mini medium | OpenAI | 1 | 7.8 | $0.786 | 2/3 | 4.37s |
| #102 | Kimi K2.7 Code medium | Moonshot AI | 1 | 5.9 | $0.687 | 1/3 | 41.0s |
| #116 | Kimi K2.6 medium | Moonshot AI | 1 | 6.0 | $1.247 | 1/3 | 25.1s |
| #118 | Muse Glimmer 30B high | Meta | 1 | 6.1 | $0.430 | 1/3 | 64.8s |
| #120 | Qwen3.7 Flash low | Qwen | 1 | 7.3 | $0.043 | 1/3 | 9.79s |
| #123 | Muse Glimmer 30B low | Meta | 1 | 7.7 | $0.152 | 2/3 | 5.06s |
| #125 | Solar Pro 4 high | Upstage | 1 | 8.7 | $0.046 | 2/3 | 55.2s |
| #126 | Grok 4.3 medium | X AI | 1 | 5.9 | $0.741 | 1/3 | 22.5s |
| #128 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.0 | $0.078 | 1/3 | 37.7s |
| #131 | Mercury 2 medium | Inception | 1 | 5.4 | $0.094 | 1/3 | 949ms |
| #134 | Kimi K2.5 medium | Moonshot AI | 1 | 5.3 | $0.479 | 1/3 | 43.2s |