خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
303/303
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #275 | Nemotron 3.5 Lightning low | NVIDIA | 3 | 3.6 | $0.140 | 0/3 | 52.7s |
| #276 | GPT-5.4 Nano none | OpenAI | 3 | 2.9 | $0.041 | 0/3 | 880ms |
| #277 | Trinity Large Thinking high | Arcee AI | 3 | 2.9 | $0.592 | 0/3 | 66.9s |
| #279 | KAT-Coder-Air V2.5 none | Kwaipilot | 3 | 3.0 | $0.070 | 0/3 | 8.33s |
| #285 | Cobuddy medium | Baidu | 3 | 2.9 | $0.000 | 0/3 | 128.2s |
| #288 | Qwen3 Coder Next medium | Qwen | 3 | 3.6 | $0.034 | 0/3 | 570ms |
| #290 | Laguna S 2.1 none | Poolside | 3 | 3.0 | $0.022 | 0/3 | 337ms |
| #291 | Grok 4.20 Beta none | X AI | 3 | 3.0 | $0.087 | 0/3 | 611ms |
| #292 | Laguna M.1 none | Poolside | 3 | 3.6 | $0.009 | 0/3 | 5.50s |
| #293 | Elephant Alpha none | Openrouter | 3 | 3.0 | $0.000 | 0/3 | 927ms |
| #295 | Elephant Alpha medium | Openrouter | 3 | 3.0 | $0.000 | 0/3 | 925ms |
| #296 | Granite 4.2 8B none | IBM Granite | 3 | 3.0 | $0.026 | 0/3 | 53.6s |
| #303 | Granite 4.1 8B none | IBM Granite | 3 | 3.0 | $0.007 | 0/3 | 287ms |
| #304 | Nemotron 3.5 Lightning none | NVIDIA | 3 | 3.0 | $0.007 | 0/3 | 683ms |
| #312 | gpt-oss-120b none | OpenAI | 3 | 3.0 | $0.010 | 0/3 | 35.0s |