निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: कुल लागत ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #50 | Inkling Small high | Thinkingmachines | 2 | 8.4 | $0.398 | 14/22 | 30.4s |
| #109 | GLM 5.3 high | Z.ai | 1 | 7.3 | $0.403 | 13/22 | 27.8s |
| #152 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.412 | 10/22 | 113.6s |
| #71 | Qwen3.6 Plus medium | Qwen | 1 | 7.8 | $0.418 | 15/22 | 45.5s |
| #118 | Muse Glimmer 30B high | Meta | 3 | 7.2 | $0.430 | 10/22 | 66.7s |
| #154 | GLM 5V Turbo medium | Z.ai | 1 | 6.7 | $0.457 | 11/21 | 23.1s |
| #135 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 6.9 | $0.478 | 11/22 | 24.9s |
| #134 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.479 | 10/22 | 98.2s |
| #83 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.489 | 10/22 | 92.5s |
| #155 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #68 | Step 3.7 Flash medium | Stepfun | 1 | 7.9 | $0.495 | 13/22 | 23.5s |
| #58 | Muse Glimmer 30B xhigh | Meta | 1 | 8.1 | $0.510 | 13/22 | 95.6s |
| #93 | GPT 5.3 Chat none | OpenAI | 2 | 7.5 | $0.533 | 13/22 | 6.56s |
| #300 | Grok Build 0.1 none | X AI | 2 | 4.0 | $0.547 | 7/19 | 28.7s |
| #181 | Claude Sonnet 5 none | Anthropic | 1 | 6.1 | $0.548 | 7/22 | 6.05s |