নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা
দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: সঠিক টেস্ট ↓.
215/215
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | নির্দেশনা অনুসরণ করা হয়নি সংখ্যা | স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #87 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $2.961 | 13/22 | 32.2s |
| #89 | DeepSeek V4 Flash 0423 high | DeepSeek | 2 | 7.6 | $0.042 | 13/22 | 51.8s |
| #98 | GPT 5.3 Chat none | OpenAI | 2 | 7.5 | $0.533 | 13/22 | 6.56s |
| #100 | Qwen3.5-27B medium | Qwen | 2 | 7.5 | $0.982 | 13/22 | 113.3s |
| #114 | GLM 5.3 high | Z.ai | 1 | 7.3 | $0.403 | 13/22 | 27.8s |
| #116 | GLM 5.3 Flash high | Z.ai | 1 | 7.3 | $0.029 | 13/22 | 25.4s |
| #117 | Gemini 3.1 Flash Lite medium | 1 | 7.3 | $0.120 | 13/22 | 4.38s | |
| #120 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.92s |
| #155 | GLM 5.2 none | Z.ai | 1 | 6.7 | $0.153 | 13/22 | 9.65s |
| #158 | Gemini 3.5 Flash minimal | 1 | 6.7 | $0.300 | 13/22 | 2.65s | |
| #181 | Mimo V2 PRO medium | Xiaomi | 1 | 6.3 | $0.333 | 12/21 | 22.2s |
| #182 | MiMo-V2-Flash medium | Xiaomi | 1 | 6.3 | $0.043 | 12/21 | 20.1s |
| #224 | Gemini 3.1 Flash Lite high | 3 | 5.6 | $2.044 | 10/18 | 62.0s | |
| #62 | GPT-5 Mini medium | OpenAI | 3 | 8.1 | $0.241 | 12/22 | 27.6s |
| #65 | Muse Spark 1.1 high | Meta | 2 | 8.0 | $2.253 | 12/22 | 36.9s |