নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা
দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: প্রতিক্রিয়া সময় (গড়) ↑.
140/140
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | নির্দেশনা অনুসরণ করা হয়নি সংখ্যা | স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #129 | Nemotron 3 Ultra none | NVIDIA | 1 | 6.1 | $0.095 | 8/22 | 3.87s |
| #154 | MiMo-V2.5-Pro none | Xiaomi | 4 | 5.5 | $0.068 | 6/22 | 4.12s |
| #65 | Gemini 3.1 Flash Lite medium | 1 | 7.3 | $0.117 | 13/22 | 4.27s | |
| #64 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.3 | $0.115 | 13/22 | 4.61s | |
| #168 | MiMo-V2.5 none | Xiaomi | 1 | 5.1 | $0.025 | 5/22 | 4.62s |
| #196 | Hunter Alpha none | OpenRouter | 2 | 4.2 | $0.000 | 6/18 | 4.70s |
| #103 | Qwen3.5-27B none | Qwen | 2 | 6.5 | $0.090 | 8/22 | 4.76s |
| #66 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.91s |
| #117 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.249 | 10/22 | 5.04s |
| #123 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.15s |
| #115 | Gemma 4 31B none | 1 | 6.2 | $0.035 | 10/22 | 5.34s | |
| #161 | Qwen3.6 35B A3B none | Qwen | 2 | 5.3 | $0.061 | 4/22 | 5.52s |
| #177 | Nemotron 3 Super none | NVIDIA | 2 | 4.9 | $0.008 | 5/22 | 5.97s |
| #112 | Claude Sonnet 5 none | Anthropic | 1 | 6.3 | $0.548 | 8/22 | 6.04s |
| #54 | GPT-5.3 Chat none | OpenAI | 2 | 7.5 | $0.571 | 13/22 | 6.88s |