AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY श्रेणी विफलताएँ

एंटी-एआई ट्रिक्स: गलत उत्तर

एंटी-एआई ट्रिक्स
गलत उत्तर

देखें कि एंटी-एआई ट्रिक्स में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।

दिखाए गए मॉडल

15

कुल विफलताएँ

165

सबसे अधिक प्रभावित मॉडल

Qwen3.5-Flash 4
रैंक मॉडल कंपनी गलत उत्तर संख्या श्रेणी स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#15 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#16 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#21 Gemini 3 Flash Preview none Google 1 8.3 3/4 1.25s
#22 Gemini 3.1 Flash Lite Preview low Google 1 8.3 3/4 2.12s
#25 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#26 Claude Sonnet 4.6 medium Anthropic 1 6.5 2/4 2.98s
#27 DeepSeek V3.2 medium DeepSeek 1 8.4 3/4 30.7s
#28 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#29 Gemini 3.1 Flash Lite Preview none Google 1 7.5 2/4 1.04s
#31 GLM 5V Turbo medium Z.ai 1 7.2 2/4 10.8s
#34 Kimi K2.6 medium Moonshot AI 1 7.0 2/4 11.6s
#36 GPT-5.3 Chat none OpenAI 1 6.7 2/4 3.86s
#38 GPT-5.4 Nano medium OpenAI 1 8.3 3/4 4.52s
#39 Seed-2.0-Mini medium Bytedance Seed 1 6.6 2/4 74.7s
#40 GPT-5.2 medium OpenAI 1 6.5 2/4 7.81s

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल