AI BENCHY विफलताएँ
निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↓.
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|
| #81 | Elephant medium | Openrouter | 3 | 5.2 | 5/18 | 1.27s |
| #82 | Grok 4.20 none | X AI | 2 | 5.2 | 5/18 | 1.11s |
| #83 | Mistral Small 4 none | Mistral | 2 | 5.2 | 5/18 | 665ms |
| #85 | Elephant none | Openrouter | 3 | 5.2 | 5/18 | 1.23s |
| #86 | GPT-5.4 Mini none | OpenAI | 3 | 5.1 | 5/18 | 1.17s |
| #79 | Grok 4.20 Beta none | X AI | 3 | 5.3 | 4/18 | 1.19s |
| #80 | MiniMax M2.7 medium | Minimax | 6 | 5.3 | 4/18 | 31.1s |
| #84 | gpt-oss-120b none | OpenAI | 5 | 5.2 | 4/18 | 12.0s |
| #87 | Qwen3 Coder Next none | Qwen | 1 | 5.1 | 4/18 | 10.2s |
| #88 | Nemotron 3 Super none | NVIDIA | 4 | 5.1 | 4/18 | 8.54s |
| #89 | GPT-4o-mini none | OpenAI | 1 | 4.9 | 4/18 | 2.00s |
| #90 | Qwen3.5-9B none | Qwen | 3 | 4.8 | 4/18 | 1.47s |
| #91 | Mercury 2 none | Inception | 1 | 4.8 | 4/18 | 613ms |
| #93 | GLM 4.7 Flash medium | Z.ai | 2 | 4.6 | 4/18 | 32.3s |
| #92 | Qwen3 Coder Next medium | Qwen | 5 | 4.7 | 3/18 | 10.8s |