निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↑.
141/141
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #121 | Gemma 4 31B none | 1 | 6.2 | $0.021 | 10/22 | 5.34s | |
| #123 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.249 | 10/22 | 5.04s |
| #126 | Gemini 3.1 Flash Lite minimal | 3 | 6.1 | $0.047 | 10/22 | 1.86s | |
| #129 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.15s |
| #191 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #192 | Laguna M.1 medium | Poolside | 1 | 4.7 | $0.033 | 9/19 | 14.7s |
| #140 | Mimo V2 Omni medium | Xiaomi | 2 | 5.9 | $0.683 | 10/21 | 41.2s |
| #75 | Qwen3.7 Plus none | Qwen | 1 | 7.2 | $0.106 | 11/22 | 12.1s |
| #80 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.0 | $0.078 | 11/22 | 68.6s |
| #84 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 7.0 | $0.101 | 11/22 | 92.5s |
| #85 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 6.9 | $0.467 | 11/22 | 24.0s |
| #87 | GPT-5.6 Sol none | OpenAI | 1 | 6.9 | $0.524 | 11/22 | 2.16s |
| #114 | Ring-2.6-1T medium | Inclusionai | 2 | 6.3 | $0.103 | 11/22 | 68.7s |
| #215 | Step 3.5 Flash none | Stepfun | 1 | 2.3 | $0.020 | 6/12 | 39.0s |
| #98 | GLM 5V Turbo medium | Z.ai | 1 | 6.7 | $0.457 | 11/21 | 23.1s |