নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা
দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: সঠিক টেস্ট ↓.
215/215
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | নির্দেশনা অনুসরণ করা হয়নি সংখ্যা | স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #280 | GLM 4.7 Flash none | Z.ai | 1 | 4.8 | $0.016 | 5/22 | 8.81s |
| #289 | MiniMax M2.5 medium | Minimax | 3 | 4.6 | $0.327 | 5/22 | 69.1s |
| #313 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 1 | 3.4 | $0.000 | 4/19 | 17.1s |
| #281 | Trinity Large Preview none | Arcee AI | 3 | 4.8 | $0.008 | 4/21 | 2.98s |
| #300 | Hy3 preview none | Tencent | 4 | 4.0 | $0.007 | 4/21 | 12.9s |
| #301 | MiMo-V2-Flash none | Xiaomi | 2 | 4.0 | $0.025 | 4/21 | 2.76s |
| #238 | DeepSeek V4 Flash 0423 none | DeepSeek | 1 | 5.4 | $0.039 | 4/22 | 36.2s |
| #239 | Laguna S 2.1 medium | Poolside | 1 | 5.4 | $0.053 | 4/22 | 58.4s |
| #244 | DeepSeek V4 Flash 0731 none | DeepSeek | 2 | 5.4 | $0.011 | 4/22 | 20.7s |
| #245 | Laguna S 2.1 high | Poolside | 1 | 5.4 | $0.114 | 4/22 | 111.6s |
| #249 | Ling-2.6-1T none | Inclusionai | 2 | 5.3 | $0.016 | 4/22 | 8.59s |
| #251 | Qwen3.6 35B A3B none | Qwen | 2 | 5.3 | $0.051 | 4/22 | 5.57s |
| #261 | Qwen3.5-9B none | Qwen | 2 | 5.1 | $0.021 | 4/22 | 19.2s |
| #263 | North Mini Code none | Cohere | 2 | 5.1 | $0.000 | 4/22 | 29.9s |
| #270 | Mercury 2.5 Preview none | Inception | 1 | 4.9 | $0.018 | 4/22 | 3.51s |