AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY विफलताएँ

निर्देशों का पालन नहीं किया विफलताएँ

देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: विफलता संख्या ↑.

दिखाए गए मॉडल

15

कुल विफलताएँ

180

सबसे अधिक प्रभावित मॉडल

Qwen3.6 Plus Preview 1
रैंक मॉडल कंपनी निर्देशों का पालन नहीं किया संख्या स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#42 Claude Sonnet 4.6 none Anthropic 1 7.4 11/18 4.98s
#48 Gemma 4 31B none Google 1 6.9 10/18 4.02s
#59 Qwen3.5-Flash none Qwen 1 6.2 8/18 3.25s
#62 Gemini 2.5 Flash none Google 1 6.2 7/18 903ms
#66 GPT-5.4 none OpenAI 1 5.9 7/18 1.51s
#70 Qwen3.5-122B-A10B none Qwen 1 5.7 6/18 3.69s
#87 Qwen3 Coder Next none Qwen 1 5.1 4/18 10.2s
#89 GPT-4o-mini none OpenAI 1 4.9 4/18 2.00s
#91 Mercury 2 none Inception 1 4.8 4/18 613ms
#94 MiMo-V2-Flash none Xiaomi 1 4.5 3/18 2.79s
#6 Seed-2.0-Lite medium Bytedance Seed 2 8.6 13/18 30.4s
#7 GPT-5.3-Codex medium OpenAI 2 8.6 13/18 15.4s
#10 Qwen3.5-27B medium Qwen 2 8.4 13/18 53.0s
#16 GPT-5.4 medium OpenAI 2 8.2 13/18 18.6s
#18 GLM 5 Turbo medium Z.ai 2 8.1 12/18 17.7s

निर्देशों का पालन नहीं किया संख्या के अनुसार शीर्ष मॉडल

निर्देशों का पालन नहीं किया संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल