निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: स्कोर ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #165 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $1.045 | 10/22 | 106.1s |
| #163 | Mercury 2.5 Preview high | Inception | 2 | 6.6 | $0.030 | 12/22 | 4.01s |
| #162 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.6 | $0.672 | 12/22 | 58.5s |
| #160 | Inkling Small medium | Thinkingmachines | 4 | 6.6 | $0.113 | 10/22 | 6.30s |
| #159 | Gemini 3.1 Flash Lite Preview low | 1 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #158 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #157 | Gemini 3.5 Flash Lite low | 1 | 6.6 | $0.138 | 12/22 | 2.56s | |
| #155 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #154 | GLM 5V Turbo medium | Z.ai | 1 | 6.7 | $0.457 | 11/21 | 23.1s |
| #153 | Gemini 3.5 Flash minimal | 1 | 6.7 | $0.300 | 13/22 | 2.65s | |
| #152 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.412 | 10/22 | 113.6s |
| #150 | GLM 5.2 none | Z.ai | 1 | 6.7 | $0.153 | 13/22 | 9.65s |
| #147 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 6.8 | $0.221 | 11/22 | 48.7s |
| #146 | GLM 5.3 low | Z.ai | 1 | 6.8 | $0.257 | 12/22 | 13.6s |
| #145 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.226 | 9/22 | 11.7s |