সাধারণ জ্ঞান: ভুল উত্তর
সাধারণ জ্ঞান
ভুল উত্তর
দেখুন সাধারণ জ্ঞান এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়।
ব্যর্থতার কারণ
263/263
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #219 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 3.0 | $0.122 | 0/1 | 33.3s |
| #220 | Nemotron 3 Ultra none | NVIDIA | 1 | 3.0 | $0.084 | 0/1 | 1.83s |
| #221 | Trinity Large Thinking low | Arcee AI | 1 | 3.0 | $0.625 | 0/1 | 2.10s |
| #222 | Gemini 2.5 Flash none | 1 | 3.0 | $0.017 | 0/1 | 1.15s | |
| #224 | GPT-5.6 Terra none | OpenAI | 1 | 3.0 | $0.280 | 0/1 | 787ms |
| #226 | GPT-5 Nano medium | OpenAI | 1 | 3.0 | $0.118 | 0/1 | 20.1s |
| #227 | Qwen3.5-Flash none | Qwen | 1 | 3.0 | $0.073 | 0/1 | 588ms |
| #228 | Qwen3.5-35B-A3B none | Qwen | 1 | 3.0 | $0.151 | 0/1 | 493ms |
| #229 | Step 3.5 Flash medium | Stepfun | 1 | 3.0 | $0.132 | 0/1 | 108.4s |
| #230 | Dots 3 Note Preview medium | Dots Studio | 1 | 3.0 | $0.000 | 0/1 | 15.5s |
| #231 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/1 | 234.2s |
| #232 | Hy3 preview high | Tencent | 1 | 3.0 | $0.135 | 0/1 | 47.7s |
| #233 | GLM 5.3 Flash low | Z.ai | 1 | 3.0 | $0.030 | 0/1 | 4.54s |
| #234 | GPT-5.4 Mini none | OpenAI | 1 | 3.0 | $0.095 | 0/1 | 1.33s |
| #235 | Seed 2.1 Turbo none | Bytedance Seed | 1 | 3.0 | $0.092 | 0/1 | 2.12s |