निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: कुल लागत ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #272 | Trinity Large Thinking high | Arcee AI | 4 | 4.8 | $0.592 | 5/22 | 75.9s |
| #67 | GPT-5.2 Chat none | OpenAI | 1 | 7.9 | $0.594 | 13/22 | 7.73s |
| #194 | Trinity Large Thinking low | Arcee AI | 2 | 6.0 | $0.625 | 8/22 | 96.6s |
| #53 | Gemini 2.5 Flash medium | 1 | 8.2 | $0.644 | 15/22 | 21.1s | |
| #159 | Gemini 3.1 Flash Lite Preview low | 1 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #44 | Muse Spark 1.2 low | Meta | 3 | 8.4 | $0.655 | 15/22 | 9.77s |
| #108 | Claude Sonnet 4.6 none | Anthropic | 1 | 7.3 | $0.661 | 12/22 | 7.67s |
| #21 | Gemini 3.5 Flash medium | 1 | 9.0 | $0.665 | 18/22 | 8.48s | |
| #162 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.6 | $0.672 | 12/22 | 58.5s |
| #51 | Muse Spark 1.1 low | Meta | 3 | 8.3 | $0.673 | 13/22 | 11.9s |
| #204 | Mimo V2 Omni medium | Xiaomi | 2 | 5.9 | $0.683 | 10/21 | 41.2s |
| #102 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.4 | $0.687 | 11/22 | 80.1s |
| #54 | Muse Spark 1.3 low | Meta | 1 | 8.2 | $0.689 | 15/22 | 16.0s |
| #41 | Qwen3.8 Max low | Qwen | 1 | 8.6 | $0.702 | 16/22 | 21.8s |
| #126 | Grok 4.3 medium | X AI | 2 | 7.0 | $0.741 | 12/22 | 44.2s |