حل الألغاز: لم يتبع التعليمات
حل الألغاز
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في حل الألغاز، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
121/121
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #273 | Grok 4.20 Multi Agent Beta medium | X AI | 1 | 6.7 | $5.599 | 1/3 | 5.19s |
| #275 | GLM 4.7 Flash none | Z.ai | 1 | 6.4 | $0.016 | 1/3 | 1.20s |
| #276 | Trinity Large Preview none | Arcee AI | 1 | 3.6 | $0.008 | 0/3 | 1.97s |
| #277 | Hunter Alpha medium | OpenRouter | 1 | 6.1 | $0.000 | 1/3 | 5.35s |
| #278 | Grok 4.1 Fast medium | X AI | 1 | 5.3 | $0.069 | 1/3 | 7.40s |
| #280 | Cobuddy medium | Baidu | 1 | 3.6 | $0.000 | 0/3 | 12.8s |
| #283 | Qwen3 Coder Next medium | Qwen | 1 | 3.0 | $0.034 | 0/3 | 1.25s |
| #288 | Elephant Alpha none | Openrouter | 1 | 4.2 | $0.000 | 0/3 | 807ms |
| #289 | GLM 4.7 Flash medium | Z.ai | 1 | 2.9 | $0.168 | 0/3 | 12.9s |
| #290 | Elephant Alpha medium | Openrouter | 1 | 5.3 | $0.000 | 1/3 | 868ms |
| #292 | Hunter Alpha none | OpenRouter | 1 | 5.8 | $0.000 | 1/3 | 3.71s |
| #295 | Hy3 preview none | Tencent | 1 | 3.1 | $0.007 | 0/3 | 4.56s |
| #298 | Granite 4.1 8B none | IBM Granite | 1 | 3.2 | $0.007 | 0/3 | 608ms |
| #300 | Grok Build 0.1 none | X AI | 1 | 6.4 | $0.547 | 1/3 | 9.55s |
| #307 | gpt-oss-120b none | OpenAI | 1 | 6.0 | $0.010 | 1/3 | 8.21s |