حل الألغاز: لم يتبع التعليمات
حل الألغاز
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في حل الألغاز، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
121/121
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #182 | Gemini 3.1 Flash Lite minimal | 2 | 6.0 | $0.047 | 1/3 | 2.15s | |
| #189 | Trinity Large Thinking medium | Arcee AI | 2 | 5.2 | $0.756 | 0/3 | 2.90s |
| #219 | Gemini 3.1 Flash Lite high | 2 | 5.7 | $2.044 | 1/3 | 50.8s | |
| #227 | Nemotron 3.5 Lightning high | NVIDIA | 2 | 3.6 | $0.134 | 0/3 | 6.09s |
| #246 | Qwen3.6 35B A3B none | Qwen | 2 | 3.2 | $0.051 | 0/3 | 1.07s |
| #258 | North Mini Code none | Cohere | 2 | 3.5 | $0.000 | 0/3 | 24.4s |
| #272 | Trinity Large Thinking high | Arcee AI | 2 | 4.7 | $0.592 | 0/3 | 3.84s |
| #25 | GPT-5.3-Codex medium | OpenAI | 1 | 9.0 | $0.988 | 2/3 | 5.05s |
| #26 | Muse Spark 1.3 high | Meta | 1 | 8.7 | $1.653 | 2/3 | 38.4s |
| #34 | GLM 5.3 Flash max | Z.ai | 1 | 8.7 | $0.059 | 2/3 | 5.61s |
| #36 | Muse Spark 1.2 high | Meta | 1 | 8.2 | $1.771 | 2/3 | 10.1s |
| #37 | Muse Spark 1.2 medium | Meta | 1 | 8.7 | $1.339 | 2/3 | 9.45s |
| #38 | Muse Spark 1.1 medium | Meta | 1 | 7.9 | $1.420 | 2/3 | 42.5s |
| #42 | GPT-5.4 medium | OpenAI | 1 | 8.2 | $1.560 | 2/3 | 9.14s |
| #44 | Muse Spark 1.2 low | Meta | 1 | 8.7 | $0.655 | 2/3 | 5.17s |