إخفاقات لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار.
215/215
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #165 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $1.045 | 10/22 | 106.1s |
| #167 | Hy3 preview medium | Tencent | 1 | 6.5 | $0.049 | 14/21 | 16.3s |
| #171 | Dots 3 Note Preview high | Dots Studio | 1 | 6.4 | $0.000 | 10/22 | 67.8s |
| #173 | MiMo-V2.5 medium | Xiaomi | 1 | 6.4 | $0.104 | 11/22 | 46.3s |
| #176 | Mimo V2 PRO medium | Xiaomi | 1 | 6.3 | $0.333 | 12/21 | 22.2s |
| #177 | MiMo-V2-Flash medium | Xiaomi | 1 | 6.3 | $0.043 | 12/21 | 20.1s |
| #180 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.051 | 10/22 | 5.20s |
| #181 | Claude Sonnet 5 none | Anthropic | 1 | 6.1 | $0.548 | 7/22 | 6.05s |
| #185 | Qwen3.7 Flash none | Qwen | 1 | 6.1 | $0.019 | 7/22 | 10.1s |
| #186 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #187 | Qwen3.5-Flash medium | Qwen | 1 | 6.1 | $0.142 | 11/22 | 84.4s |
| #190 | Qwen3.6 Flash none | Qwen | 1 | 6.1 | $0.062 | 7/22 | 3.73s |
| #191 | Gemma 4 31B none | 1 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #193 | Nemotron 3 Ultra none | NVIDIA | 1 | 6.1 | $0.084 | 8/22 | 3.88s |
| #196 | Grok 4.20 Beta medium | X AI | 1 | 6.0 | $0.750 | 14/18 | 9.75s |