निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: कुल लागत ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #140 | Qwen3.6 Flash medium | Qwen | 1 | 6.8 | $0.741 | 12/22 | 45.0s |
| #196 | Grok 4.20 Beta medium | X AI | 1 | 6.0 | $0.750 | 14/18 | 9.75s |
| #189 | Trinity Large Thinking medium | Arcee AI | 4 | 6.1 | $0.756 | 8/22 | 85.4s |
| #81 | Seed-2.0-Code low | Bytedance Seed | 1 | 7.7 | $0.767 | 13/22 | 72.2s |
| #97 | GPT-5.4 Mini medium | OpenAI | 3 | 7.5 | $0.786 | 12/22 | 26.7s |
| #132 | Grok 4.20 medium | X AI | 2 | 7.0 | $0.805 | 11/22 | 32.6s |
| #55 | Claude Sonnet 5 medium | Anthropic | 1 | 8.2 | $0.922 | 15/22 | 12.5s |
| #95 | Qwen3.5-27B medium | Qwen | 2 | 7.5 | $0.982 | 13/22 | 113.3s |
| #25 | GPT-5.3-Codex medium | OpenAI | 2 | 8.9 | $0.988 | 16/22 | 16.9s |
| #165 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $1.045 | 10/22 | 106.1s |
| #59 | Inkling high | Thinkingmachines | 1 | 8.0 | $1.046 | 15/22 | 62.6s |
| #142 | Seed-2.0-Code medium | Bytedance Seed | 1 | 6.8 | $1.153 | 10/22 | 101.1s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.92s |
| #47 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $1.182 | 14/22 | 28.5s |
| #63 | GLM 5.2 high | Z.ai | 1 | 8.0 | $1.188 | 14/22 | 69.9s |