معلومات عامة: إجابة خاطئة
معلومات عامة
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في معلومات عامة، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
263/263
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #219 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 3.0 | $0.122 | 0/1 | 33.3s |
| #220 | Nemotron 3 Ultra none | NVIDIA | 1 | 3.0 | $0.084 | 0/1 | 1.83s |
| #221 | Trinity Large Thinking low | Arcee AI | 1 | 3.0 | $0.625 | 0/1 | 2.10s |
| #222 | Gemini 2.5 Flash none | 1 | 3.0 | $0.017 | 0/1 | 1.15s | |
| #224 | GPT-5.6 Terra none | OpenAI | 1 | 3.0 | $0.280 | 0/1 | 787ms |
| #226 | GPT-5 Nano medium | OpenAI | 1 | 3.0 | $0.118 | 0/1 | 20.1s |
| #227 | Qwen3.5-Flash none | Qwen | 1 | 3.0 | $0.073 | 0/1 | 588ms |
| #228 | Qwen3.5-35B-A3B none | Qwen | 1 | 3.0 | $0.151 | 0/1 | 493ms |
| #229 | Step 3.5 Flash medium | Stepfun | 1 | 3.0 | $0.132 | 0/1 | 108.4s |
| #230 | Dots 3 Note Preview medium | Dots Studio | 1 | 3.0 | $0.000 | 0/1 | 15.5s |
| #231 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/1 | 234.2s |
| #232 | Hy3 preview high | Tencent | 1 | 3.0 | $0.135 | 0/1 | 47.7s |
| #233 | GLM 5.3 Flash low | Z.ai | 1 | 3.0 | $0.030 | 0/1 | 4.54s |
| #234 | GPT-5.4 Mini none | OpenAI | 1 | 3.0 | $0.095 | 0/1 | 1.33s |
| #235 | Seed 2.1 Turbo none | Bytedance Seed | 1 | 3.0 | $0.092 | 0/1 | 2.12s |