إخفاقات إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: إجمالي التكلفة ↑.
309/309
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #170 | Dots 3 Note Preview low | Dots Studio | 7 | 6.4 | $0.000 | 10/22 | 61.8s |
| #171 | Dots 3 Note Preview high | Dots Studio | 8 | 6.4 | $0.000 | 10/22 | 67.8s |
| #203 | Dots 3 Note Preview medium | Dots Studio | 9 | 5.9 | $0.000 | 8/22 | 67.1s |
| #211 | North Mini Code medium | Cohere | 9 | 5.7 | $0.000 | 8/22 | 142.0s |
| #222 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #225 | Owl Alpha none | Openrouter | 10 | 5.6 | $0.000 | 7/21 | 9.88s |
| #247 | Dots 3 Note Preview none | Dots Studio | 15 | 5.2 | $0.000 | 3/22 | 3.53s |
| #258 | North Mini Code none | Cohere | 12 | 5.1 | $0.000 | 4/22 | 29.9s |
| #264 | Qwen3.6 Plus Preview medium | Qwen | 2 | 4.9 | $0.000 | 9/19 | 15.2s |
| #277 | Hunter Alpha medium | OpenRouter | 4 | 4.7 | $0.000 | 8/18 | 10.3s |
| #280 | Cobuddy medium | Baidu | 9 | 4.7 | $0.000 | 7/21 | 39.9s |
| #288 | Elephant Alpha none | Openrouter | 9 | 4.3 | $0.000 | 5/21 | 1.22s |
| #290 | Elephant Alpha medium | Openrouter | 9 | 4.3 | $0.000 | 6/21 | 1.27s |
| #292 | Hunter Alpha none | OpenRouter | 9 | 4.2 | $0.000 | 6/18 | 4.70s |
| #297 | Ling 3.0 Tiny none | Inclusionai | 13 | 4.0 | $0.000 | 2/22 | 14.0s |