निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: कुल लागत ↓.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #159 | Gemini 3.1 Flash Lite Preview low | 1 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #53 | Gemini 2.5 Flash medium | 1 | 8.2 | $0.644 | 15/22 | 21.1s | |
| #194 | Trinity Large Thinking low | Arcee AI | 2 | 6.0 | $0.625 | 8/22 | 96.6s |
| #67 | GPT-5.2 Chat none | OpenAI | 1 | 7.9 | $0.594 | 13/22 | 7.73s |
| #272 | Trinity Large Thinking high | Arcee AI | 4 | 4.8 | $0.592 | 5/22 | 75.9s |
| #181 | Claude Sonnet 5 none | Anthropic | 1 | 6.1 | $0.548 | 7/22 | 6.05s |
| #300 | Grok Build 0.1 none | X AI | 2 | 4.0 | $0.547 | 7/19 | 28.7s |
| #93 | GPT 5.3 Chat none | OpenAI | 2 | 7.5 | $0.533 | 13/22 | 6.56s |
| #58 | Muse Glimmer 30B xhigh | Meta | 1 | 8.1 | $0.510 | 13/22 | 95.6s |
| #68 | Step 3.7 Flash medium | Stepfun | 1 | 7.9 | $0.495 | 13/22 | 23.5s |
| #155 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #83 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.489 | 10/22 | 92.5s |
| #134 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.479 | 10/22 | 98.2s |
| #135 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 6.9 | $0.478 | 11/22 | 24.9s |
| #154 | GLM 5V Turbo medium | Z.ai | 1 | 6.7 | $0.457 | 11/21 | 23.1s |