निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: कुल लागत ↓.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #240 | Laguna S 2.1 high | Poolside | 1 | 5.4 | $0.114 | 4/22 | 111.6s |
| #160 | Inkling Small medium | Thinkingmachines | 4 | 6.6 | $0.113 | 10/22 | 6.30s |
| #113 | Qwen3.7 Plus none | Qwen | 1 | 7.3 | $0.106 | 12/22 | 12.1s |
| #173 | MiMo-V2.5 medium | Xiaomi | 1 | 6.4 | $0.104 | 11/22 | 46.3s |
| #175 | Ring-2.6-1T medium | Inclusionai | 2 | 6.4 | $0.102 | 11/22 | 68.8s |
| #252 | Mistral Small 4 medium | Mistral | 2 | 5.1 | $0.097 | 5/22 | 10.8s |
| #207 | GPT-5.4 Mini none | OpenAI | 3 | 5.9 | $0.095 | 6/22 | 1.58s |
| #131 | Mercury 2 medium | Inception | 3 | 7.0 | $0.094 | 10/22 | 2.95s |
| #286 | Grok 4.20 Beta none | X AI | 1 | 4.4 | $0.087 | 6/18 | 1.19s |
| #62 | DeepSeek V4 Flash 0731 high | DeepSeek | 2 | 8.0 | $0.084 | 14/22 | 114.9s |
| #193 | Nemotron 3 Ultra none | NVIDIA | 1 | 6.1 | $0.084 | 8/22 | 3.88s |
| #261 | Laguna S 2.1 low | Poolside | 1 | 5.0 | $0.082 | 3/22 | 85.3s |
| #128 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.0 | $0.078 | 11/22 | 68.4s |
| #69 | Qwen3.8 27B low | Qwen | 1 | 7.9 | ~$0.071 | 15/22 | 39.1s |
| #278 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |