निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: स्कोर ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #125 | Solar Pro 4 high | Upstage | 3 | 7.1 | $0.046 | 11/22 | 120.6s |
| #123 | Muse Glimmer 30B low | Meta | 3 | 7.1 | $0.152 | 11/22 | 18.6s |
| #121 | Muse Glimmer 30B medium | Meta | 1 | 7.2 | $0.227 | 11/22 | 30.6s |
| #120 | Qwen3.7 Flash low | Qwen | 3 | 7.2 | $0.043 | 11/22 | 38.0s |
| #118 | Muse Glimmer 30B high | Meta | 3 | 7.2 | $0.430 | 10/22 | 66.7s |
| #116 | Kimi K2.6 medium | Moonshot AI | 2 | 7.2 | $1.247 | 12/22 | 115.9s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.92s |
| #113 | Qwen3.7 Plus none | Qwen | 1 | 7.3 | $0.106 | 12/22 | 12.1s |
| #112 | Gemini 3.1 Flash Lite medium | 1 | 7.3 | $0.120 | 13/22 | 4.38s | |
| #111 | GLM 5.3 Flash high | Z.ai | 1 | 7.3 | $0.029 | 13/22 | 25.4s |
| #109 | GLM 5.3 high | Z.ai | 1 | 7.3 | $0.403 | 13/22 | 27.8s |
| #108 | Claude Sonnet 4.6 none | Anthropic | 1 | 7.3 | $0.661 | 12/22 | 7.67s |
| #105 | Qwen3.8 2.4T A95B high | Qwen | 2 | 7.4 | $2.357 | 14/22 | 120.6s |
| #102 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.4 | $0.687 | 11/22 | 80.1s |
| #100 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.4 | $0.117 | 14/22 | 4.59s |