নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা
দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: স্কোর ↓.
215/215
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | নির্দেশনা অনুসরণ করা হয়নি সংখ্যা | স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #206 | Qwen3.5-35B-A3B none | Qwen | 2 | 5.9 | $0.076 | 6/22 | 12.7s |
| #207 | Step 3.5 Flash medium | Stepfun | 3 | 5.9 | $0.132 | 10/21 | 191.6s |
| #208 | Dots 3 Note Preview medium | Dots Studio | 2 | 5.9 | $0.000 | 8/22 | 67.1s |
| #209 | Mimo V2 Omni medium | Xiaomi | 2 | 5.9 | $0.683 | 10/21 | 41.2s |
| #211 | GLM 5.3 Flash low | Z.ai | 2 | 5.9 | $0.015 | 10/22 | 9.65s |
| #212 | GPT-5.4 Mini none | OpenAI | 3 | 5.9 | $0.095 | 6/22 | 1.58s |
| #214 | GPT-5.4 none | OpenAI | 1 | 5.8 | $0.397 | 7/22 | 2.08s |
| #217 | Nemotron 3 Super medium | NVIDIA | 3 | 5.7 | $0.050 | 8/22 | 52.3s |
| #219 | Inkling Small low | Thinkingmachines | 2 | 5.7 | $0.055 | 9/22 | 2.07s |
| #220 | Ling-3.0-flash none | Inclusionai | 1 | 5.7 | $0.004 | 6/22 | 3.56s |
| #222 | Kimi K2.6 none | Moonshot AI | 3 | 5.7 | $0.233 | 6/22 | 19.6s |
| #223 | Qwen3.5-122B-A10B none | Qwen | 2 | 5.7 | $0.283 | 6/22 | 12.9s |
| #224 | Gemini 3.1 Flash Lite high | 3 | 5.6 | $2.044 | 10/18 | 62.0s | |
| #226 | GLM 5V Turbo none | Z.ai | 2 | 5.6 | $0.052 | 8/21 | 2.99s |
| #227 | Owl Alpha medium | Openrouter | 2 | 5.6 | $0.000 | 8/21 | 11.9s |