خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: إجمالي التكلفة ↑.
أسباب الفشل
299/299
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #170 | Dots 3 Note Preview low | Dots Studio | 3 | 3.6 | $0.000 | 0/3 | 49.5s |
| #171 | Dots 3 Note Preview high | Dots Studio | 2 | 5.3 | $0.000 | 1/3 | 69.4s |
| #203 | Dots 3 Note Preview medium | Dots Studio | 3 | 3.6 | $0.000 | 0/3 | 47.5s |
| #211 | North Mini Code medium | Cohere | 2 | 2.9 | $0.000 | 0/3 | 107.2s |
| #222 | Owl Alpha medium | Openrouter | 2 | 5.3 | $0.000 | 1/3 | 8.58s |
| #225 | Owl Alpha none | Openrouter | 2 | 5.3 | $0.000 | 1/3 | 3.00s |
| #247 | Dots 3 Note Preview none | Dots Studio | 3 | 3.0 | $0.000 | 0/3 | 1.10s |
| #258 | North Mini Code none | Cohere | 3 | 3.0 | $0.000 | 0/3 | 14.7s |
| #264 | Qwen3.6 Plus Preview medium | Qwen | 2 | 3.0 | $0.000 | 0/3 | 22.1s |
| #277 | Hunter Alpha medium | OpenRouter | 1 | 3.0 | $0.000 | 0/3 | 10.5s |
| #280 | Cobuddy medium | Baidu | 3 | 2.9 | $0.000 | 0/3 | 128.2s |
| #288 | Elephant Alpha none | Openrouter | 3 | 3.0 | $0.000 | 0/3 | 927ms |
| #290 | Elephant Alpha medium | Openrouter | 3 | 3.0 | $0.000 | 0/3 | 925ms |
| #292 | Hunter Alpha none | OpenRouter | 2 | 5.3 | $0.000 | 1/3 | 2.33s |
| #297 | Ling 3.0 Tiny none | Inclusionai | 2 | 3.0 | $0.000 | 0/3 | 880ms |