خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
303/303
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #172 | Hy3 preview medium | Tencent | 2 | 5.3 | $0.049 | 1/3 | 22.3s |
| #173 | Gemini 3.1 Flash Lite Preview none | 2 | 5.3 | $0.052 | 1/3 | 811ms | |
| #174 | Qwen3.6 Max Preview none | Qwen | 2 | 5.3 | $0.228 | 1/3 | 1.23s |
| #176 | Dots 3 Note Preview high | Dots Studio | 2 | 5.3 | $0.000 | 1/3 | 69.4s |
| #177 | LongCat 2.0 none | Meituan | 2 | 5.3 | $0.044 | 1/3 | 1.68s |
| #179 | Ling-3.0-flash high | Inclusionai | 2 | 3.0 | $0.021 | 0/3 | 30.3s |
| #182 | MiMo-V2-Flash medium | Xiaomi | 2 | 5.9 | $0.043 | 1/3 | 96.0s |
| #184 | Gemma 4 31B medium | 2 | 5.3 | $0.100 | 1/3 | 59.9s | |
| #190 | Qwen3.7 Flash none | Qwen | 2 | 5.3 | $0.019 | 1/3 | 814ms |
| #192 | Qwen3.5-Flash medium | Qwen | 2 | 2.9 | $0.142 | 0/3 | 143.8s |
| #193 | Inkling low | Thinkingmachines | 2 | 5.3 | $0.187 | 1/3 | 1.68s |
| #194 | Trinity Large Thinking medium | Arcee AI | 2 | 5.3 | $0.756 | 1/3 | 124.2s |
| #195 | Qwen3.6 Flash none | Qwen | 2 | 5.3 | $0.062 | 1/3 | 963ms |
| #196 | Gemma 4 31B none | 2 | 5.3 | $0.016 | 1/3 | 3.65s | |
| #197 | Qwen3.5 Plus 2026-04-20 none | Qwen | 2 | 5.3 | $0.122 | 1/3 | 1.06s |