নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা
দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: সঠিক টেস্ট ↑.
141/141
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | নির্দেশনা অনুসরণ করা হয়নি সংখ্যা | স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #120 | Qwen3.5-Flash medium | Qwen | 1 | 6.2 | $0.139 | 12/22 | 84.8s |
| #149 | Gemini 3.1 Flash Lite high | 3 | 5.6 | $2.044 | 10/18 | 62.0s | |
| #115 | Mimo V2 PRO medium | Xiaomi | 1 | 6.3 | $0.333 | 12/21 | 22.2s |
| #119 | MiMo-V2-Flash medium | Xiaomi | 1 | 6.3 | $0.043 | 12/21 | 20.1s |
| #27 | Muse Spark 1.1 low | Meta | 2 | 8.3 | $0.647 | 13/22 | 11.5s |
| #47 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $3.059 | 13/22 | 34.3s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 2 | 7.7 | $0.041 | 13/22 | 49.7s |
| #58 | GPT-5.3 Chat none | OpenAI | 2 | 7.5 | $0.571 | 13/22 | 6.88s |
| #62 | Qwen3.5-27B medium | Qwen | 2 | 7.4 | $1.627 | 13/22 | 111.9s |
| #68 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.3 | $0.115 | 13/22 | 4.61s | |
| #69 | Gemini 3.1 Flash Lite medium | 1 | 7.3 | $0.117 | 13/22 | 4.27s | |
| #70 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.91s |
| #77 | Grok 4.3 medium | X AI | 2 | 7.1 | $0.779 | 13/22 | 47.4s |
| #94 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.7 | $0.746 | 13/22 | 58.1s |
| #110 | Gemini 3.1 Flash Lite Preview low | 1 | 6.5 | $0.646 | 13/22 | 16.7s |