निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↑.
141/141
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #136 | Step 3.5 Flash medium | Stepfun | 3 | 6.0 | $0.108 | 11/21 | 174.2s |
| #29 | GPT-5 Mini medium | OpenAI | 3 | 8.1 | $0.237 | 12/22 | 27.6s |
| #30 | Muse Spark 1.1 high | Meta | 2 | 8.1 | $1.694 | 12/22 | 31.5s |
| #51 | MiniMax M3 medium | Minimax | 2 | 7.6 | $0.286 | 12/22 | 75.0s |
| #56 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.5 | $0.740 | 12/22 | 84.2s |
| #57 | GPT-5.4 Nano medium | OpenAI | 2 | 7.5 | $0.138 | 12/22 | 13.2s |
| #60 | GPT-5.4 Mini medium | OpenAI | 3 | 7.5 | $0.756 | 12/22 | 25.9s |
| #67 | Claude Sonnet 4.6 none | Anthropic | 1 | 7.3 | $0.661 | 12/22 | 8.12s |
| #72 | Kimi K2.6 medium | Moonshot AI | 2 | 7.2 | $1.036 | 12/22 | 110.0s |
| #79 | Grok 4.20 medium | X AI | 2 | 7.1 | $0.777 | 12/22 | 29.5s |
| #88 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 6.9 | $0.187 | 12/22 | 33.9s |
| #89 | Qwen3.6 Flash medium | Qwen | 1 | 6.9 | $0.738 | 12/22 | 44.7s |
| #101 | GLM 5.2 none | Z.ai | 1 | 6.6 | $0.128 | 12/22 | 9.34s |
| #107 | MiMo-V2.5 medium | Xiaomi | 1 | 6.5 | $0.082 | 12/22 | 32.2s |
| #112 | Gemini 3.1 Flash Lite Preview none | 2 | 6.4 | $0.052 | 12/22 | 1.58s |