সাধারণ জ্ঞান: ভুল উত্তর
সাধারণ জ্ঞান
ভুল উত্তর
দেখুন সাধারণ জ্ঞান এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়।
ব্যর্থতার কারণ
263/263
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #153 | Mercury 2 medium | Inception | 1 | 3.0 | $0.094 | 0/1 | 2.58s |
| #154 | Grok 4.20 medium | X AI | 1 | 3.0 | $0.805 | 0/1 | 63.5s |
| #155 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 3.0 | $0.116 | 0/1 | 56.8s |
| #156 | Kimi K2.5 medium | Moonshot AI | 1 | 3.0 | $0.479 | 0/1 | 83.9s |
| #157 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 3.0 | $0.478 | 0/1 | 9.87s |
| #158 | Claude Fable 5.1 low | Anthropic | 1 | 3.0 | $2.565 | 0/1 | 19.2s |
| #159 | Qwen3.7 Flash medium | Qwen | 1 | 3.0 | $0.065 | 0/1 | 29.2s |
| #160 | Seed-2.0-Code high | Bytedance Seed | 1 | 3.0 | $1.273 | 0/1 | 52.2s |
| #161 | Gemini 3.5 Flash none | 1 | 2.8 | $1.093 | 0/1 | 4.87s | |
| #162 | Qwen3.6 Flash medium | Qwen | 1 | 3.0 | $0.741 | 0/1 | 122.9s |
| #165 | GLM 5.3 FlashX high | Z.ai | 1 | 3.0 | $0.135 | 0/1 | 5.34s |
| #166 | Solar Pro 4 low | Upstage | 1 | 3.0 | $0.130 | 0/1 | 69.2s |
| #167 | Solar Pro 4 medium | Upstage | 1 | 3.0 | $0.140 | 0/1 | 108.6s |
| #168 | DeepSeek V4 Pro none | DeepSeek | 1 | 3.0 | $0.196 | 0/1 | 5.76s |
| #169 | GLM 5.3 low | Z.ai | 1 | 3.0 | $0.167 | 0/1 | 7.42s |