AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY श्रेणी विफलताएँ

एंटी-एआई ट्रिक्स: गलत उत्तर

एंटी-एआई ट्रिक्स
गलत उत्तर

देखें कि एंटी-एआई ट्रिक्स में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।

दिखाए गए मॉडल

15

कुल विफलताएँ

165

सबसे अधिक प्रभावित मॉडल

Qwen3.5-Flash 4
रैंक मॉडल कंपनी गलत उत्तर संख्या श्रेणी स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#59 Qwen3.5-Flash none Qwen 4 3.5 0/4 1.32s
#61 Seed-2.0-Lite none Bytedance Seed 4 3.0 0/4 2.43s
#62 Gemini 2.5 Flash none Google 4 3.0 0/4 582ms
#63 Qwen3.5-35B-A3B none Qwen 4 3.4 0/4 1.43s
#65 MiMo-V2-Pro none Xiaomi 4 3.5 0/4 1.80s
#66 GPT-5.4 none OpenAI 4 3.2 0/4 1.21s
#72 Hunter Alpha none OpenRouter 4 3.5 0/4 3.81s
#75 GLM 5.1 none Z.ai 4 4.0 0/4 2.11s
#76 Kimi K2.5 none Moonshot AI 4 3.6 0/4 6.24s
#77 GLM 5 Turbo none Z.ai 4 3.0 0/4 2.84s
#78 Trinity Large Preview none Arcee AI 4 3.0 0/4 3.02s
#79 Grok 4.20 Beta none X AI 4 4.0 0/4 597ms
#83 Mistral Small 4 none Mistral 4 3.4 0/4 395ms
#86 GPT-5.4 Mini none OpenAI 4 3.1 0/4 929ms
#90 Qwen3.5-9B none Qwen 4 3.1 0/4 1.71s

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल