ডোমেইন-নির্দিষ্ট: ভুল উত্তর
ডোমেইন-নির্দিষ্ট
ভুল উত্তর
দেখুন ডোমেইন-নির্দিষ্ট এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়।
ব্যর্থতার কারণ
198/198
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #101 | MiMo-V2.5 medium | Xiaomi | 1 | 5.3 | $0.082 | 1/3 | 34.5s |
| #109 | Mimo V2 PRO medium | Xiaomi | 1 | 5.3 | $0.333 | 1/3 | 8.82s |
| #110 | Gemma 4 31B medium | 1 | 7.7 | $0.163 | 2/3 | 38.5s | |
| #114 | Qwen3.5-Flash medium | Qwen | 1 | 5.3 | $0.139 | 1/3 | 146.5s |
| #115 | Gemma 4 31B none | 1 | 7.7 | $0.035 | 2/3 | 3.22s | |
| #119 | Qwen3.5-35B-A3B medium | Qwen | 1 | 4.1 | $0.837 | 0/3 | 88.3s |
| #125 | Qwen3.5-Flash none | Qwen | 1 | 7.7 | $0.073 | 2/3 | 905ms |
| #127 | Qwen3.5-35B-A3B none | Qwen | 1 | 7.7 | $0.106 | 2/3 | 485ms |
| #128 | GPT-5 Nano medium | OpenAI | 1 | 5.2 | $0.114 | 1/3 | 204.0s |
| #134 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/3 | 47.9s |
| #144 | KAT-Coder-Air V2.5 high | Kwaipilot | 1 | 2.9 | $0.077 | 0/3 | 7.47s |
| #152 | Qwen3.6 27B none | Qwen | 1 | 7.7 | $0.087 | 2/3 | 3.03s |
| #167 | Mistral Small 4 medium | Mistral | 1 | 5.3 | $0.096 | 1/3 | 6.11s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 3.0 | $0.163 | 0/3 | 19.0s |
| #176 | GLM 4.7 Flash none | Z.ai | 1 | 7.7 | $0.016 | 2/3 | 744ms |