निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: स्कोर ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #97 | GPT-5.4 Mini medium | OpenAI | 3 | 7.5 | $0.786 | 12/22 | 26.7s |
| #96 | Mercury 2.5 Preview medium | Inception | 1 | 7.5 | $0.024 | 15/22 | 3.58s |
| #95 | Qwen3.5-27B medium | Qwen | 2 | 7.5 | $0.982 | 13/22 | 113.3s |
| #93 | GPT 5.3 Chat none | OpenAI | 2 | 7.5 | $0.533 | 13/22 | 6.56s |
| #92 | MiniMax M3 medium | Minimax | 2 | 7.5 | $0.300 | 11/22 | 75.2s |
| #90 | GPT-5.4 Nano medium | OpenAI | 2 | 7.5 | $0.142 | 12/22 | 13.3s |
| #87 | Solar Pro 4 xhigh | Upstage | 3 | 7.6 | $0.050 | 12/22 | 134.9s |
| #85 | GLM 5 Turbo medium | Z.ai | 1 | 7.6 | $0.323 | 14/21 | 23.0s |
| #84 | DeepSeek V4 Flash 0423 high | DeepSeek | 2 | 7.6 | $0.039 | 13/22 | 51.8s |
| #83 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.489 | 10/22 | 92.5s |
| #82 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $2.961 | 13/22 | 32.2s |
| #81 | Seed-2.0-Code low | Bytedance Seed | 1 | 7.7 | $0.767 | 13/22 | 72.2s |
| #80 | GLM 5 medium | Z.ai | 1 | 7.7 | $0.228 | 15/21 | 33.5s |
| #79 | Qwen3.7 Flash high | Qwen | 1 | 7.8 | $0.052 | 13/22 | 41.4s |
| #77 | Seed-2.0-Lite medium | Bytedance Seed | 2 | 7.8 | $0.236 | 13/22 | 47.9s |