خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
299/299
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #202 | Step 3.5 Flash medium | Stepfun | 3 | 3.5 | $0.132 | 0/3 | 311.6s |
| #203 | Dots 3 Note Preview medium | Dots Studio | 3 | 3.6 | $0.000 | 0/3 | 47.5s |
| #206 | GLM 5.3 Flash low | Z.ai | 3 | 3.6 | $0.015 | 0/3 | 7.93s |
| #207 | GPT-5.4 Mini none | OpenAI | 3 | 3.6 | $0.095 | 0/3 | 1.31s |
| #210 | Solar Pro 4 none | Upstage | 3 | 2.9 | $0.006 | 0/3 | 4.65s |
| #213 | GLM 5 none | Z.ai | 3 | 3.0 | $0.027 | 0/3 | 2.24s |
| #217 | Kimi K2.6 none | Moonshot AI | 3 | 2.9 | $0.233 | 0/3 | 1.39s |
| #219 | Gemini 3.1 Flash Lite high | 3 | 3.6 | $2.044 | 0/3 | 139.9s | |
| #227 | Nemotron 3.5 Lightning high | NVIDIA | 3 | 2.9 | $0.134 | 0/3 | 88.6s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 3 | 3.0 | $0.037 | 0/3 | 15.3s |
| #234 | Laguna S 2.1 medium | Poolside | 3 | 3.0 | $0.053 | 0/3 | 2.68s |
| #236 | GPT-5.6 Luna none | OpenAI | 3 | 3.6 | $0.029 | 0/3 | 784ms |
| #237 | MiMo-V2.5-Pro none | Xiaomi | 3 | 3.0 | $0.068 | 0/3 | 1.79s |
| #238 | Kimi K2.5 none | Moonshot AI | 3 | 3.0 | $0.101 | 0/3 | 2.75s |
| #240 | Laguna S 2.1 high | Poolside | 3 | 3.0 | $0.114 | 0/3 | 2.51s |