AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY श्रेणी विफलताएँ

सामान्य ज्ञान: गलत उत्तर

सामान्य ज्ञान
गलत उत्तर

देखें कि सामान्य ज्ञान में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.

दिखाए गए मॉडल

15

कुल विफलताएँ

117

सबसे अधिक प्रभावित मॉडल

MiMo-V2-Omni 1

विफलता के कारण

रैंक मॉडल कंपनी गलत उत्तर संख्या श्रेणी स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#62 MiMo-V2-Omni medium Xiaomi 1 3.0 0/1 234.2s
#38 Gemma 4 26B A4B medium Google 1 3.0 0/1 180.9s
#57 Qwen3.5-35B-A3B medium Qwen 1 3.0 0/1 177.4s
#140 Qwen3.5-9B medium Qwen 1 3.0 0/1 177.0s
#42 Kimi K2.6 medium Moonshot AI 1 3.0 0/1 130.3s
#50 Qwen3.6 Flash medium Qwen 1 3.0 0/1 122.9s
#36 Step 3.5 Flash none Stepfun 1 3.0 0/1 114.1s
#43 Step 3.5 Flash medium Stepfun 1 3.0 0/1 108.4s
#12 Qwen3.5 Plus 2026-02-15 medium Qwen 1 3.0 0/1 103.8s
#33 Qwen3.5 Plus 2026-04-20 medium Qwen 1 3.0 0/1 92.6s
#14 Gemma 4 31B medium Google 1 3.0 0/1 90.1s
#17 Qwen3.5-27B medium Qwen 1 3.0 0/1 85.1s
#59 DeepSeek V3.2 medium DeepSeek 1 3.0 0/1 84.0s
#69 Kimi K2.5 medium Moonshot AI 1 3.0 0/1 83.9s
#37 MiMo-V2-Pro medium Xiaomi 1 3.0 0/1 82.7s

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल