خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
303/303
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #226 | GLM 5V Turbo none | Z.ai | 2 | 5.3 | $0.052 | 1/3 | 2.09s |
| #227 | Owl Alpha medium | Openrouter | 2 | 5.3 | $0.000 | 1/3 | 8.58s |
| #228 | Gemma 4 26B A4B none | 2 | 5.3 | $0.015 | 1/3 | 2.10s | |
| #229 | Mimo V2 PRO none | Xiaomi | 2 | 5.3 | $0.045 | 1/3 | 1.78s |
| #230 | Owl Alpha none | Openrouter | 2 | 5.3 | $0.000 | 1/3 | 3.00s |
| #231 | KAT-Coder-Air V2.5 medium | Kwaipilot | 2 | 3.0 | $0.048 | 0/3 | 6.58s |
| #233 | Hy4 preview low | Tencent | 2 | 4.5 | $1.745 | 0/3 | 470.2s |
| #235 | Hy3 preview low | Tencent | 2 | 5.9 | $0.042 | 1/3 | 40.4s |
| #237 | Mimo V2 Omni none | Xiaomi | 2 | 5.3 | $0.021 | 1/3 | 2.10s |
| #244 | DeepSeek V4 Flash 0731 none | DeepSeek | 2 | 5.3 | $0.011 | 1/3 | 1.17s |
| #246 | Inkling Small none | Thinkingmachines | 2 | 5.3 | $0.054 | 1/3 | 442ms |
| #247 | Laguna XS 2.1 none | Poolside | 2 | 5.3 | $0.008 | 1/3 | 303ms |
| #250 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 1/3 | 127.6s | |
| #253 | Inkling none | Thinkingmachines | 2 | 5.3 | $0.147 | 1/3 | 1.18s |
| #254 | Granite 4.2 8B medium | IBM Granite | 2 | 5.3 | $0.009 | 1/3 | 14.0s |