AI BENCHY
Advertise here

AI BENCHY श्रेणी विफलताएँ

पहेली समाधान: गलत उत्तर

पहेली समाधान
गलत उत्तर

देखें कि पहेली समाधान में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

15

कुल विफलताएँ

147

सबसे अधिक प्रभावित मॉडल

Gemini 3.5 Flash 1
रैंक मॉडल कंपनी गलत उत्तर संख्या श्रेणी स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#7 Gemini 3.5 Flash medium Google 1 7.7 2/3 2.38s
#24 GPT-5.2 Chat none OpenAI 1 7.7 2/3 4.10s
#28 Gemini 2.5 Flash medium Google 1 7.7 2/3 3.18s
#36 Qwen3.5 Plus 2026-04-20 medium Qwen 1 8.2 2/3 17.7s
#40 Gemini 3.1 Flash Lite Preview medium Google 1 7.7 2/3 5.30s
#44 Gemini 3.1 Flash Lite medium Google 1 7.6 2/3 1.95s
#46 Qwen3.6 35B A3B medium Qwen 1 8.0 2/3 5.95s
#47 Grok Build 0.1 medium X AI 1 7.7 2/3 18.3s
#48 Gemini 3 Flash Preview none Google 1 7.7 2/3 1.05s
#55 GLM 5.1 medium Z.ai 1 8.2 2/3 31.6s
#59 GLM 5V Turbo medium Z.ai 1 7.7 2/3 10.2s
#64 MiMo-V2-Flash medium Xiaomi 1 7.7 2/3 3.87s
#65 Grok 4.20 medium X AI 1 7.7 2/3 6.22s
#67 MiniMax M3 medium Minimax 1 7.9 2/3 49.9s
#69 Claude Opus 4.6 medium Anthropic 1 7.7 2/3 4.71s

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल