AI BENCHY
Advertise here

AI BENCHY श्रेणी विफलताएँ

संयुक्त: गलत उत्तर

संयुक्त
गलत उत्तर

देखें कि संयुक्त में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।

दिखाए गए मॉडल

15

कुल विफलताएँ

52

सबसे अधिक प्रभावित मॉडल

Gemini 3 Flash Preview 1
रैंक मॉडल कंपनी गलत उत्तर संख्या श्रेणी स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#16 Gemini 3 Flash Preview low Google 1 3.0 0/1 3.27s
#34 Qwen3.7 Max none Qwen 1 3.0 0/1 2.17s
#35 Gemini 3 PRO Preview medium Google 1 3.0 0/1 10.4s
#48 Gemini 3 Flash Preview none Google 1 4.7 0/1 3.56s
#50 Gemini 3.1 Flash Lite Preview low Google 1 3.0 0/1 11.9s
#51 Mimo V2 PRO medium Xiaomi 1 4.7 0/1 64.7s
#58 Gemini 3.1 Flash Lite Preview none Google 1 3.0 0/1 3.20s
#61 Gemini 3.1 Flash Lite low Google 1 3.0 0/1 4.48s
#74 Qwen3.6 Max Preview none Qwen 1 3.0 0/1 20.5s
#87 Gemini 3.1 Flash Lite minimal Google 1 3.0 0/1 2.53s
#90 Gemini 3.1 Flash Lite none Google 1 3.0 0/1 2.73s
#91 GPT-5.5 none OpenAI 1 3.0 0/1 5.56s
#95 Qwen3.5 Plus 2026-02-15 none Qwen 1 3.0 0/1 6.65s
#97 Gemini 2.5 Flash none Google 1 3.0 0/1 4.39s
#98 GLM 5 none Z.ai 1 3.0 0/1 4.98s

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल