AI BENCHY
Advertise here

AI BENCHY विफलताएँ

गलत उत्तर विफलताएँ

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

15

कुल विफलताएँ

1204

सबसे अधिक प्रभावित मॉडल

Gemini 3 Flash Preview 1
रैंक मॉडल कंपनी गलत उत्तर संख्या स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#50 Gemini 3.1 Flash Lite Preview low Google 7 7.4 13/21 2.77s
#52 Claude Sonnet 4.6 medium Anthropic 4 7.4 13/21 17.1s
#39 Qwen3.6 Flash medium Qwen 8 7.5 12/21 19.2s
#43 MiMo-V2.5-Pro medium Xiaomi 3 7.5 12/21 26.1s
#45 GPT-5.4 Mini medium OpenAI 6 7.5 12/21 22.3s
#49 Qwen3.5-Flash medium Qwen 4 7.4 12/21 63.3s
#51 Mimo V2 PRO medium Xiaomi 5 7.4 12/21 22.2s
#54 GPT-5 Mini medium OpenAI 5 7.3 12/21 23.6s
#55 GLM 5.1 medium Z.ai 4 7.3 12/21 33.7s
#56 MiMo-V2.5 medium Xiaomi 5 7.3 12/21 27.1s
#57 Step 3.7 Flash low Stepfun 8 7.3 12/21 15.7s
#58 Gemini 3.1 Flash Lite Preview none Google 7 7.2 12/21 1.21s
#60 Kimi K2.6 medium Moonshot AI 3 7.2 12/21 71.7s
#61 Gemini 3.1 Flash Lite low Google 9 7.2 12/21 1.89s
#63 GPT-5.3 Chat none OpenAI 7 7.2 12/21 6.34s

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल