AI BENCHY
Advertise here

AI BENCHY ব্যর্থতা

ভুল উত্তর ব্যর্থতা

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি ভুল উত্তর সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: প্রতিক্রিয়া সময় (গড়) ↑.

দেখানো মডেল

15

মোট ব্যর্থতা

1204

সবচেয়ে বেশি প্রভাবিত মডেল

Mistral Small 4 15
র‍্যাঙ্ক মডেল কোম্পানি ভুল উত্তর সংখ্যা স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#41 Nemotron 3 Ultra 550b A55b medium NVIDIA 7 7.5 13/21 15.1s
#93 Qwen3.6 Plus Preview medium Qwen 2 6.3 9/19 15.2s
#28 Gemini 2.5 Flash medium Google 6 7.8 14/21 15.5s
#57 Step 3.7 Flash low Stepfun 8 7.3 12/21 15.7s
#5 Qwen3.7 Max medium Qwen 3 9.1 18/21 16.0s
#15 GPT-5.3-Codex medium OpenAI 4 8.4 15/21 16.2s
#33 Hy3 preview medium Tencent 3 7.7 14/21 16.3s
#42 GPT-5.2 medium OpenAI 3 7.5 13/21 16.9s
#52 Claude Sonnet 4.6 medium Anthropic 4 7.4 13/21 17.1s
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 7 4.6 4/19 17.1s
#46 Qwen3.6 35B A3B medium Qwen 4 7.4 13/21 18.1s
#1 Gemini 3 Flash Preview medium Google 1 9.8 20/21 18.6s
#39 Qwen3.6 Flash medium Qwen 8 7.5 12/21 19.2s
#64 MiMo-V2-Flash medium Xiaomi 5 7.2 12/21 20.1s
#4 Gemini 3.1 Pro Preview medium Google 2 9.4 19/21 20.1s

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল