निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: कुल लागत ↓.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #120 | Qwen3.7 Flash low | Qwen | 3 | 7.2 | $0.043 | 11/22 | 38.0s |
| #271 | GPT-5.4 Nano none | OpenAI | 2 | 4.8 | $0.041 | 4/22 | 2.56s |
| #268 | Hy4 preview none | Tencent | 2 | 4.8 | $0.041 | 3/22 | 39.2s |
| #84 | DeepSeek V4 Flash 0423 high | DeepSeek | 2 | 7.6 | $0.039 | 13/22 | 51.8s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 1 | 5.4 | $0.037 | 4/22 | 36.2s |
| #283 | Qwen3 Coder Next medium | Qwen | 3 | 4.6 | $0.034 | 3/22 | 9.07s |
| #279 | Laguna M.1 medium | Poolside | 1 | 4.7 | $0.033 | 9/19 | 14.7s |
| #281 | Mercury 2 none | Inception | 1 | 4.7 | $0.030 | 4/22 | 825ms |
| #163 | Mercury 2.5 Preview high | Inception | 2 | 6.6 | $0.030 | 12/22 | 4.01s |
| #111 | GLM 5.3 Flash high | Z.ai | 1 | 7.3 | $0.029 | 13/22 | 25.4s |
| #269 | Ring-2.6-1T none | Inclusionai | 2 | 4.8 | $0.026 | 9/22 | 52.0s |
| #254 | Qwen3 Coder Next none | Qwen | 1 | 5.1 | $0.026 | 5/22 | 8.63s |
| #291 | Granite 4.2 8B none | IBM Granite | 1 | 4.3 | $0.026 | 3/22 | 86.3s |
| #255 | MiMo-V2.5 none | Xiaomi | 1 | 5.1 | $0.025 | 5/22 | 4.68s |
| #296 | MiMo-V2-Flash none | Xiaomi | 2 | 4.0 | $0.025 | 4/21 | 2.76s |