সাধারণ জ্ঞান: ভুল উত্তর
সাধারণ জ্ঞান
ভুল উত্তর
দেখুন সাধারণ জ্ঞান এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: মোট খরচ ↓.
ব্যর্থতার কারণ
197/197
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #15 | GPT-5.5 medium | OpenAI | 1 | 2.8 | $4.137 | 0/1 | 37.9s |
| #60 | Claude Opus 4.6 medium | Anthropic | 1 | 3.0 | $3.059 | 0/1 | 63.2s |
| #56 | Claude Sonnet 4.6 medium | Anthropic | 1 | 3.0 | $2.057 | 0/1 | 30.1s |
| #35 | Grok 4.5 medium | X AI | 1 | 3.0 | $1.928 | 0/1 | 74.4s |
| #41 | Muse Spark 1.1 high | Meta | 1 | 3.0 | $1.694 | 0/1 | 22.9s |
| #20 | Muse Spark 1.2 high | Meta | 1 | 3.0 | $1.632 | 0/1 | 15.0s |
| #29 | GPT-5.4 medium | OpenAI | 1 | 3.0 | $1.533 | 0/1 | 14.0s |
| #23 | Claude Opus 4.7 medium | Anthropic | 1 | 3.0 | $1.477 | 0/1 | 2.25s |
| #26 | Muse Spark 1.1 medium | Meta | 1 | 3.0 | $1.357 | 0/1 | 18.5s |
| #6 | GPT-5.6 Sol medium | OpenAI | 1 | 4.7 | $1.316 | 0/1 | 4.94s |
| #8 | GPT-5.5 low | OpenAI | 1 | 3.0 | $1.253 | 0/1 | 10.1s |
| #7 | GPT-5.6 Sol high | OpenAI | 1 | 4.7 | $1.234 | 0/1 | 6.97s |
| #25 | Muse Spark 1.2 medium | Meta | 1 | 3.0 | $1.227 | 0/1 | 12.8s |
| #31 | Qwen3.6 Max Preview medium | Qwen | 1 | 3.0 | $1.129 | 0/1 | 60.6s |
| #28 | Claude Opus 5 low | Anthropic | 1 | 3.0 | $1.121 | 0/1 | 6.48s |