خاص بالمجال: إجابة خاطئة
خاص بالمجال
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
303/303
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #199 | Trinity Large Thinking low | Arcee AI | 2 | 2.9 | $0.625 | 0/3 | 140.3s |
| #201 | Grok 4.20 Beta medium | X AI | 2 | 5.3 | $0.750 | 1/3 | 21.3s |
| #202 | GPT-5.6 Terra none | OpenAI | 2 | 5.3 | $0.280 | 1/3 | 843ms |
| #203 | Gemini 3 PRO Preview medium | 2 | 5.3 | $0.385 | 1/3 | 7.01s | |
| #204 | GPT-5 Nano medium | OpenAI | 2 | 3.4 | $0.118 | 0/3 | 124.1s |
| #205 | Qwen3.5-Flash none | Qwen | 2 | 5.3 | $0.073 | 1/3 | 873ms |
| #206 | Qwen3.5-35B-A3B none | Qwen | 2 | 5.3 | $0.076 | 1/3 | 507ms |
| #210 | Hy3 preview high | Tencent | 2 | 5.3 | $0.135 | 1/3 | 109.0s |
| #214 | GPT-5.4 none | OpenAI | 2 | 5.3 | $0.397 | 1/3 | 1.15s |
| #216 | North Mini Code medium | Cohere | 2 | 2.9 | $0.000 | 0/3 | 107.2s |
| #217 | Nemotron 3 Super medium | NVIDIA | 2 | 2.9 | $0.050 | 0/3 | 19.4s |
| #219 | Inkling Small low | Thinkingmachines | 2 | 5.3 | $0.055 | 1/3 | 852ms |
| #220 | Ling-3.0-flash none | Inclusionai | 2 | 3.0 | $0.004 | 0/3 | 840ms |
| #221 | GLM 5.1 none | Z.ai | 2 | 5.3 | $0.164 | 1/3 | 2.27s |
| #223 | Qwen3.5-122B-A10B none | Qwen | 2 | 5.3 | $0.283 | 1/3 | 523ms |