निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: स्कोर ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #144 | Solar Pro 4 medium | Upstage | 2 | 6.8 | $0.047 | 12/22 | 127.6s |
| #143 | Solar Pro 4 low | Upstage | 2 | 6.8 | $0.044 | 11/22 | 136.1s |
| #142 | Seed-2.0-Code medium | Bytedance Seed | 1 | 6.8 | $1.153 | 10/22 | 101.1s |
| #140 | Qwen3.6 Flash medium | Qwen | 1 | 6.8 | $0.741 | 12/22 | 45.0s |
| #138 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.9 | $1.273 | 11/22 | 124.2s |
| #137 | Qwen3.7 Flash medium | Qwen | 3 | 6.9 | $0.065 | 10/22 | 47.4s |
| #136 | Claude Fable 5.1 low | Anthropic | 3 | 6.9 | $2.565 | 11/22 | 10.3s |
| #135 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 6.9 | $0.478 | 11/22 | 24.9s |
| #134 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.479 | 10/22 | 98.2s |
| #133 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 7.0 | $0.116 | 11/22 | 93.1s |
| #132 | Grok 4.20 medium | X AI | 2 | 7.0 | $0.805 | 11/22 | 32.6s |
| #131 | Mercury 2 medium | Inception | 3 | 7.0 | $0.094 | 10/22 | 2.95s |
| #128 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.0 | $0.078 | 11/22 | 68.4s |
| #127 | GPT-5.6 Sol none | OpenAI | 1 | 7.0 | $0.201 | 12/22 | 2.17s |
| #126 | Grok 4.3 medium | X AI | 2 | 7.0 | $0.741 | 12/22 | 44.2s |