निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: कुल लागत ↓.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #42 | GPT-5.4 medium | OpenAI | 2 | 8.5 | $1.560 | 15/22 | 22.9s |
| #38 | Muse Spark 1.1 medium | Meta | 2 | 8.6 | $1.420 | 15/22 | 26.2s |
| #37 | Muse Spark 1.2 medium | Meta | 3 | 8.6 | $1.339 | 14/22 | 19.7s |
| #138 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.9 | $1.273 | 11/22 | 124.2s |
| #116 | Kimi K2.6 medium | Moonshot AI | 2 | 7.2 | $1.247 | 12/22 | 115.9s |
| #63 | GLM 5.2 high | Z.ai | 1 | 8.0 | $1.188 | 14/22 | 69.9s |
| #47 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $1.182 | 14/22 | 28.5s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.92s |
| #142 | Seed-2.0-Code medium | Bytedance Seed | 1 | 6.8 | $1.153 | 10/22 | 101.1s |
| #59 | Inkling high | Thinkingmachines | 1 | 8.0 | $1.046 | 15/22 | 62.6s |
| #165 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $1.045 | 10/22 | 106.1s |
| #25 | GPT-5.3-Codex medium | OpenAI | 2 | 8.9 | $0.988 | 16/22 | 16.9s |
| #95 | Qwen3.5-27B medium | Qwen | 2 | 7.5 | $0.982 | 13/22 | 113.3s |
| #55 | Claude Sonnet 5 medium | Anthropic | 1 | 8.2 | $0.922 | 15/22 | 12.5s |
| #132 | Grok 4.20 medium | X AI | 2 | 7.0 | $0.805 | 11/22 | 32.6s |