ডোমেইন-নির্দিষ্ট: ভুল উত্তর
ডোমেইন-নির্দিষ্ট
ভুল উত্তর
দেখুন ডোমেইন-নির্দিষ্ট এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: ব্যর্থতার সংখ্যা ↑.
ব্যর্থতার কারণ
198/198
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #2 | Gemini 3.5 Flash high | 1 | 7.6 | $1.976 | 2/3 | 14.1s | |
| #7 | Gemini 3.1 Pro Preview medium | 1 | 7.7 | $1.361 | 2/3 | 32.7s | |
| #9 | Gemini 3.5 Flash medium | 1 | 7.7 | $0.642 | 2/3 | 5.24s | |
| #11 | Gemini 3.5 Flash low | 1 | 7.7 | $0.433 | 2/3 | 3.39s | |
| #21 | GPT-5.2 medium | OpenAI | 1 | 5.9 | $0.951 | 1/3 | 77.8s |
| #23 | Claude Sonnet 5 medium | Anthropic | 1 | 7.7 | $0.922 | 2/3 | 20.4s |
| #28 | Inkling high | Thinkingmachines | 1 | 7.7 | $1.006 | 2/3 | 186.4s |
| #29 | Step 3.7 Flash medium | Stepfun | 1 | 7.7 | $0.515 | 2/3 | 48.3s |
| #31 | GLM 5.2 high | Z.ai | 1 | 3.7 | $0.970 | 0/3 | 74.0s |
| #38 | GLM 5.2 medium | Z.ai | 1 | 4.1 | $0.222 | 0/3 | 45.5s |
| #40 | Claude Sonnet 4.6 medium | Anthropic | 1 | 2.9 | $2.057 | 0/3 | 0ms |
| #43 | Claude Opus 4.6 medium | Anthropic | 1 | 3.0 | $3.059 | 0/3 | 83.4s |
| #44 | GPT-5.6 Luna high | OpenAI | 1 | 7.7 | $1.017 | 2/3 | 79.0s |
| #48 | Grok Build 0.1 medium | X AI | 1 | 5.3 | $1.097 | 1/3 | 158.0s |
| #57 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 5.3 | $0.437 | 1/3 | 17.5s |