নির্দেশনা অনুসরণ: ভুল উত্তর
নির্দেশনা অনুসরণ
ভুল উত্তর
দেখুন নির্দেশনা অনুসরণ এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: মোট খরচ ↓.
ব্যর্থতার কারণ
61/61
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #63 | Claude Sonnet 4.6 none | Anthropic | 1 | 6.5 | $0.661 | 1/2 | 1.96s |
| #87 | GPT-5.5 none | OpenAI | 1 | 6.2 | $0.544 | 1/2 | 1.15s |
| #74 | GLM 5.1 medium | Z.ai | 1 | 6.4 | $0.535 | 1/2 | 7.47s |
| #60 | LongCat 2.0 medium | Meituan | 1 | 6.5 | $0.478 | 1/2 | 7.38s |
| #97 | LongCat 2.0 high | Meituan | 1 | 6.5 | $0.469 | 1/2 | 6.96s |
| #139 | GPT-5.4 none | OpenAI | 1 | 6.5 | $0.397 | 1/2 | 1.07s |
| #91 | LongCat 2.0 low | Meituan | 1 | 6.5 | $0.391 | 1/2 | 6.39s |
| #88 | Gemini 3.5 Flash minimal | 1 | 6.4 | $0.300 | 1/2 | 893ms | |
| #142 | Qwen3.5-122B-A10B none | Qwen | 1 | 6.3 | $0.247 | 1/2 | 513ms |
| #138 | Kimi K2.6 none | Moonshot AI | 1 | 6.5 | $0.184 | 1/2 | 1.64s |
| #194 | GLM 4.7 Flash medium | Z.ai | 1 | 6.2 | $0.166 | 1/2 | 2.97s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 3.8 | $0.163 | 0/2 | 12.8s |
| #164 | Inkling none | Thinkingmachines | 1 | 6.3 | $0.147 | 1/2 | 1.72s |
| #159 | GPT-5.6 Luna none | OpenAI | 1 | 7.1 | $0.142 | 1/2 | 1.23s |
| #155 | Kimi K2.5 none | Moonshot AI | 1 | 6.5 | $0.127 | 1/2 | 2.67s |