AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY विफलताएँ

गलत उत्तर विफलताएँ

देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: स्कोर ↓.

दिखाए गए मॉडल

7

कुल विफलताएँ

572

सबसे अधिक प्रभावित मॉडल

Gemini 3.1 Pro Preview 1
रैंक मॉडल कंपनी गलत उत्तर संख्या स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#92 Qwen3 Coder Next medium Qwen 9 4.7 3/18 10.8s
#93 GLM 4.7 Flash medium Z.ai 8 4.6 4/18 32.3s
#94 MiMo-V2-Flash none Xiaomi 12 4.5 3/18 2.79s
#95 Grok 4.1 Fast none X AI 13 4.5 3/18 1.76s
#96 GPT-5.4 Nano none OpenAI 13 4.5 2/18 1.40s
#97 Qwen3.5-9B medium Qwen 1 4.4 3/18 73.6s
#98 LFM2-24B-A2B none Liquid 9 4.1 1/16 811ms

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल