निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: स्कोर ↓.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #92 | MiniMax M3 medium | Minimax | 2 | 7.5 | $0.300 | 11/22 | 75.2s |
| #93 | GPT 5.3 Chat none | OpenAI | 2 | 7.5 | $0.533 | 13/22 | 6.56s |
| #95 | Qwen3.5-27B medium | Qwen | 2 | 7.5 | $0.982 | 13/22 | 113.3s |
| #96 | Mercury 2.5 Preview medium | Inception | 1 | 7.5 | $0.024 | 15/22 | 3.58s |
| #97 | GPT-5.4 Mini medium | OpenAI | 3 | 7.5 | $0.786 | 12/22 | 26.7s |
| #100 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.4 | $0.117 | 14/22 | 4.59s | |
| #102 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.4 | $0.687 | 11/22 | 80.1s |
| #105 | Qwen3.8 2.4T A95B high | Qwen | 2 | 7.4 | $2.357 | 14/22 | 120.6s |
| #108 | Claude Sonnet 4.6 none | Anthropic | 1 | 7.3 | $0.661 | 12/22 | 7.67s |
| #109 | GLM 5.3 high | Z.ai | 1 | 7.3 | $0.403 | 13/22 | 27.8s |
| #111 | GLM 5.3 Flash high | Z.ai | 1 | 7.3 | $0.029 | 13/22 | 25.4s |
| #112 | Gemini 3.1 Flash Lite medium | 1 | 7.3 | $0.120 | 13/22 | 4.38s | |
| #113 | Qwen3.7 Plus none | Qwen | 1 | 7.3 | $0.106 | 12/22 | 12.1s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.92s |
| #116 | Kimi K2.6 medium | Moonshot AI | 2 | 7.2 | $1.247 | 12/22 | 115.9s |