AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY विफलताएँ

गलत उत्तर विफलताएँ

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.

दिखाए गए मॉडल

15

कुल विफलताएँ

1204

सबसे अधिक प्रभावित मॉडल

Kimi K2.5 5
रैंक मॉडल कंपनी गलत उत्तर संख्या स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#39 Qwen3.6 Flash medium Qwen 8 7.5 12/21 19.2s
#1 Gemini 3 Flash Preview medium Google 1 9.8 20/21 18.6s
#46 Qwen3.6 35B A3B medium Qwen 4 7.4 13/21 18.1s
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 7 4.6 4/19 17.1s
#52 Claude Sonnet 4.6 medium Anthropic 4 7.4 13/21 17.1s
#42 GPT-5.2 medium OpenAI 3 7.5 13/21 16.9s
#33 Hy3 preview medium Tencent 3 7.7 14/21 16.3s
#15 GPT-5.3-Codex medium OpenAI 4 8.4 15/21 16.2s
#5 Qwen3.7 Max medium Qwen 3 9.1 18/21 16.0s
#57 Step 3.7 Flash low Stepfun 8 7.3 12/21 15.7s
#28 Gemini 2.5 Flash medium Google 6 7.8 14/21 15.5s
#93 Qwen3.6 Plus Preview medium Qwen 2 6.3 9/19 15.2s
#41 Nemotron 3 Ultra 550b A55b medium NVIDIA 7 7.5 13/21 15.1s
#92 Laguna M.1 medium Poolside 4 6.4 9/19 14.7s
#133 DeepSeek V3.2 none DeepSeek 7 5.2 6/21 13.8s

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल