إخفاقات لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↓.
141/141
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #168 | Ling-2.6-1T none | Inclusionai | 2 | 5.3 | $0.016 | 4/22 | 8.58s |
| #155 | KAT-Coder-Air V2.5 medium | Kwaipilot | 1 | 5.6 | $0.048 | 8/22 | 8.42s |
| #12 | Gemini 3.5 Flash medium | 1 | 9.1 | $0.642 | 19/22 | 8.20s | |
| #67 | Claude Sonnet 4.6 none | Anthropic | 1 | 7.3 | $0.661 | 12/22 | 8.12s |
| #34 | GPT-5.2 Chat none | OpenAI | 1 | 8.0 | $0.604 | 14/22 | 7.65s |
| #162 | Gemma 4 26B A4B none | 2 | 5.5 | $0.015 | 8/22 | 7.64s | |
| #58 | GPT-5.3 Chat none | OpenAI | 2 | 7.5 | $0.571 | 13/22 | 6.88s |
| #118 | Claude Sonnet 5 none | Anthropic | 1 | 6.3 | $0.548 | 8/22 | 6.04s |
| #183 | Nemotron 3 Super none | NVIDIA | 2 | 4.9 | $0.008 | 5/22 | 5.97s |
| #167 | Qwen3.6 35B A3B none | Qwen | 2 | 5.3 | $0.061 | 4/22 | 5.52s |
| #121 | Gemma 4 31B none | 1 | 6.2 | $0.021 | 10/22 | 5.34s | |
| #129 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.15s |
| #123 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.249 | 10/22 | 5.04s |
| #70 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.91s |
| #109 | Qwen3.5-27B none | Qwen | 2 | 6.5 | $0.090 | 8/22 | 4.76s |