সাধারণ জ্ঞান: ভুল উত্তর
সাধারণ জ্ঞান
ভুল উত্তর
দেখুন সাধারণ জ্ঞান এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়।
ব্যর্থতার কারণ
263/263
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #55 | Grok 4.5 medium | X AI | 1 | 3.0 | $2.042 | 0/1 | 74.4s |
| #56 | Muse Spark 1.2 low | Meta | 1 | 3.0 | $0.655 | 0/1 | 10.00s |
| #57 | Grok 4.6 medium | X AI | 1 | 3.0 | $1.713 | 0/1 | 46.9s |
| #58 | Grok 4.5 low | X AI | 1 | 3.0 | $0.945 | 0/1 | 14.0s |
| #59 | GPT-5.2 medium | OpenAI | 1 | 3.0 | $1.182 | 0/1 | 28.2s |
| #60 | Qwen3.8 27B high | Qwen | 1 | 3.0 | ~$0.287 | 0/1 | 264.0s |
| #62 | Seed 2.1 Turbo medium | Bytedance Seed | 1 | 3.0 | $1.951 | 0/1 | 91.0s |
| #63 | Inkling Small high | Thinkingmachines | 1 | 3.0 | $0.398 | 0/1 | 49.3s |
| #65 | DeepSeek V4.1 Flash max | DeepSeek | 1 | 3.0 | $0.537 | 0/1 | 98.5s |
| #66 | Muse Spark 1.1 low | Meta | 1 | 3.0 | $0.673 | 0/1 | 8.17s |
| #68 | Gemini 2.5 Flash medium | 1 | 3.0 | $0.644 | 0/1 | 2.76s | |
| #69 | Muse Spark 1.3 low | Meta | 1 | 3.0 | $0.689 | 0/1 | 23.4s |
| #70 | Claude Sonnet 5 medium | Anthropic | 1 | 3.0 | $0.922 | 0/1 | 7.06s |
| #71 | Qwen3.8 2.4T A95B low | Qwen | 1 | 3.0 | $2.672 | 0/1 | 422.5s |
| #72 | GPT-5 Mini medium | OpenAI | 1 | 3.0 | $0.241 | 0/1 | 9.99s |