إخفاقات لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↓.
140/140
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #191 | Grok 4.20 Beta none | X AI | 1 | 4.4 | $0.087 | 6/18 | 1.19s |
| #189 | Mercury 2 none | Inception | 1 | 4.6 | $0.030 | 4/22 | 829ms |
| #205 | Laguna Xs.2 none | Poolside | 1 | 3.8 | $0.004 | 5/19 | 806ms |
| #210 | LFM2-24B-A2B none | Liquid | 1 | 2.2 | $0.001 | 2/16 | 782ms |
| #208 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 2 | 3.2 | $0.000 | 2/19 | 728ms |