إخفاقات لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار.
215/215
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #259 | MiniMax M2.7 medium | Minimax | 5 | 5.0 | $0.208 | 5/22 | 43.2s |
| #160 | Inkling Small medium | Thinkingmachines | 4 | 6.6 | $0.113 | 10/22 | 6.30s |
| #189 | Trinity Large Thinking medium | Arcee AI | 4 | 6.1 | $0.756 | 8/22 | 85.4s |
| #227 | Nemotron 3.5 Lightning high | NVIDIA | 4 | 5.6 | $0.134 | 5/22 | 58.3s |
| #237 | MiMo-V2.5-Pro none | Xiaomi | 4 | 5.4 | $0.068 | 5/22 | 4.24s |
| #272 | Trinity Large Thinking high | Arcee AI | 4 | 4.8 | $0.592 | 5/22 | 75.9s |
| #278 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #295 | Hy3 preview none | Tencent | 4 | 4.0 | $0.007 | 4/21 | 12.9s |
| #297 | Ling 3.0 Tiny none | Inclusionai | 4 | 4.0 | $0.000 | 2/22 | 14.0s |
| #298 | Granite 4.1 8B none | IBM Granite | 4 | 4.0 | $0.007 | 2/22 | 1.44s |
| #302 | Ling 3.0 Tiny low | Inclusionai | 4 | 3.8 | $0.000 | 4/22 | 66.2s |
| #305 | Ling 3.0 Tiny medium | Inclusionai | 4 | 3.8 | $0.000 | 4/22 | 68.1s |
| #36 | Muse Spark 1.2 high | Meta | 3 | 8.7 | $1.771 | 14/22 | 26.6s |
| #37 | Muse Spark 1.2 medium | Meta | 3 | 8.6 | $1.339 | 14/22 | 19.7s |
| #44 | Muse Spark 1.2 low | Meta | 3 | 8.4 | $0.655 | 15/22 | 9.77s |