AI BENCHY
Your ad here

AI BENCHY विफलताएँ

निर्देशों का पालन नहीं किया विफलताएँ

देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.

दिखाए गए मॉडल

15

कुल विफलताएँ

180

सबसे अधिक प्रभावित मॉडल

Qwen3.5-9B 2
रैंक मॉडल कंपनी निर्देशों का पालन नहीं किया संख्या स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#9 Qwen3.6 Plus Preview medium Qwen 1 8.5 13/17 13.9s
#23 MiMo-V2-Pro medium Xiaomi 1 8.1 12/18 12.3s
#15 Gemini 2.5 Flash medium Google 1 8.2 13/18 12.1s
#84 gpt-oss-120b none OpenAI 5 5.2 4/18 12.0s
#38 GPT-5.4 Nano medium OpenAI 3 7.6 11/18 11.2s
#92 Qwen3 Coder Next medium Qwen 5 4.7 3/18 10.8s
#50 Hunter Alpha medium OpenRouter 2 6.7 8/18 10.3s
#47 Grok 4.20 medium X AI 4 7.0 9/18 10.3s
#87 Qwen3 Coder Next none Qwen 1 5.1 4/18 10.2s
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#56 Grok 4.20 Multi Agent Beta medium X AI 4 6.4 7/18 9.80s
#88 Nemotron 3 Super none NVIDIA 4 5.1 4/18 8.54s
#28 GPT-5.2 Chat none OpenAI 1 7.9 12/18 6.84s
#60 Gemma 4 26B A4B none Google 3 6.2 7/18 6.59s
#36 GPT-5.3 Chat none OpenAI 2 7.7 11/18 5.88s

निर्देशों का पालन नहीं किया संख्या के अनुसार शीर्ष मॉडल

निर्देशों का पालन नहीं किया संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल