AI BENCHY বিভাগীয় ব্যর্থতা
নির্দেশনা অনুসরণ
নির্দেশনা অনুসরণ করা হয়নি
নির্দেশনা অনুসরণ
নির্দেশনা অনুসরণ করা হয়নি
দেখুন নির্দেশনা অনুসরণ এ কোন AI মডেলগুলোর নির্দেশনা অনুসরণ করা হয়নি হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: সঠিক টেস্ট ↓.
সম্পর্কিত ব্যর্থতার কারণ
সম্পর্কিত বিভাগ
| র্যাঙ্ক | মডেল | কোম্পানি | নির্দেশনা অনুসরণ করা হয়নি সংখ্যা | বিভাগ স্কোর | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|
| #8 | Gemini 3.1 Flash Lite Preview high | 1 | 9.0 | 1/2 | 70.1s | |
| #13 | Step 3.5 Flash medium | Stepfun | 1 | 9.0 | 1/2 | 4.98s |
| #30 | Grok 4.1 Fast medium | X AI | 1 | 5.5 | 1/2 | 5.30s |
| #32 | GPT-5 Mini medium | OpenAI | 1 | 7.5 | 1/2 | 15.7s |
| #34 | GPT-5 Nano medium | OpenAI | 1 | 9.0 | 1/2 | 11.9s |
| #43 | MiniMax M2.5 medium | Minimax | 1 | 8.0 | 1/2 | 4.64s |
| #45 | Trinity Large Preview none | Arcee AI | 1 | 3.5 | 0/2 | 1.09s |
| #47 | GPT-4o-mini none | OpenAI | 1 | 4.5 | 0/2 | 1.27s |
| #50 | Qwen3 Coder Next medium | Qwen | 1 | 4.5 | 0/2 | 7.34s |