خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: إجمالي التكلفة ↑.
198/198
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #137 | North Mini Code medium | Cohere | 2 | 5.3 | $0.000 | 1/3 | 71.4s |
| #146 | Owl Alpha medium | Openrouter | 2 | 5.3 | $0.000 | 1/3 | 8.58s |
| #148 | Owl Alpha none | Openrouter | 2 | 5.3 | $0.000 | 1/3 | 3.00s |
| #171 | North Mini Code none | Cohere | 3 | 3.0 | $0.000 | 0/3 | 14.7s |
| #175 | Qwen3.6 Plus Preview medium | Qwen | 2 | 3.0 | $0.000 | 0/3 | 22.1s |
| #184 | Hunter Alpha medium | OpenRouter | 1 | 3.0 | $0.000 | 0/3 | 10.5s |
| #188 | Cobuddy medium | Baidu | 3 | 2.9 | $0.000 | 0/3 | 128.2s |
| #193 | Elephant Alpha none | Openrouter | 3 | 3.0 | $0.000 | 0/3 | 927ms |
| #195 | Elephant Alpha medium | Openrouter | 3 | 3.0 | $0.000 | 0/3 | 925ms |
| #196 | Hunter Alpha none | OpenRouter | 2 | 5.3 | $0.000 | 1/3 | 2.33s |
| #207 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 2 | 2.9 | $0.000 | 0/3 | 56.7s |
| #208 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 3 | 3.6 | $0.000 | 0/3 | 489ms |
| #210 | LFM2-24B-A2B none | Liquid | 1 | 5.9 | $0.001 | 1/3 | 287ms |
| #178 | Ling-2.6-flash none | Inclusionai | 3 | 3.0 | $0.002 | 0/3 | 4.95s |
| #199 | Hy3 preview none | Tencent | 2 | 3.6 | $0.003 | 0/3 | 17.6s |