AI BENCHY
Your ad here

AI BENCHY श्रेणी अपयशे

कोडी सोडवणे: चुकीचे उत्तर

कोडी सोडवणे
चुकीचे उत्तर

कोडी सोडवणे मध्ये कोणत्या AI मॉडेल्सना चुकीचे उत्तर येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील.

दाखवलेली मॉडेल्स

15

एकूण अपयशे

85

सर्वाधिक प्रभावित मॉडेल

Kimi K2.5 3
क्रमांक मॉडेल कंपनी चुकीचे उत्तर संख्या श्रेणी स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#15 Gemini 2.5 Flash medium Google 1 7.7 2/3 3.94s
#17 Gemini 3.1 Flash Lite Preview medium Google 1 7.7 2/3 3.58s
#21 Gemini 3 Flash Preview none Google 1 7.7 2/3 1.06s
#27 DeepSeek V3.2 medium DeepSeek 1 8.2 2/3 36.9s
#28 GPT-5.2 Chat none OpenAI 1 7.7 2/3 4.42s
#30 Step 3.5 Flash medium Stepfun 1 5.3 1/3 7.72s
#33 GLM 5.1 medium Z.ai 1 8.2 2/3 23.8s
#34 Kimi K2.6 medium Moonshot AI 1 5.0 0/3 25.6s
#35 MiMo-V2-Omni medium Xiaomi 1 6.5 1/3 3.88s
#37 Claude Opus 4.6 medium Anthropic 1 7.7 2/3 4.60s
#38 GPT-5.4 Nano medium OpenAI 1 4.0 0/3 3.65s
#39 Seed-2.0-Mini medium Bytedance Seed 1 8.2 2/3 25.9s
#41 MiMo-V2-Flash medium Xiaomi 1 7.7 2/3 3.77s
#43 Qwen3.5-35B-A3B medium Qwen 1 6.4 1/3 31.6s
#45 GPT-5 Mini medium OpenAI 1 5.6 1/3 14.1s

चुकीचे उत्तर संख्या नुसार शीर्ष मॉडेल्स

चुकीचे उत्तर संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स

अंदाजित वाया गेलेला खर्च नुसार शीर्ष मॉडेल्स