AI BENCHY
Your ad here

AI BENCHY ব্যর্থতা

ভুল উত্তর ব্যর্থতা

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি ভুল উত্তর সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: প্রতিক্রিয়া সময় (গড়) ↓.

দেখানো মডেল

15

মোট ব্যর্থতা

572

সবচেয়ে বেশি প্রভাবিত মডেল

Qwen3.5-9B 1
র‍্যাঙ্ক মডেল কোম্পানি ভুল উত্তর সংখ্যা স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#75 GLM 5.1 none Z.ai 10 5.6 5/18 4.33s
#53 GLM 5 none Z.ai 9 6.6 9/18 4.23s
#48 Gemma 4 31B none Google 5 6.9 10/18 4.02s
#63 Qwen3.5-35B-A3B none Qwen 9 6.1 7/18 3.82s
#17 Gemini 3.1 Flash Lite Preview medium Google 4 8.2 13/18 3.74s
#70 Qwen3.5-122B-A10B none Qwen 11 5.7 6/18 3.69s
#3 Claude Opus 4.7 medium Anthropic 1 9.2 16/18 3.53s
#74 GLM 4.7 Flash none Z.ai 10 5.6 5/18 3.35s
#59 Qwen3.5-Flash none Qwen 9 6.2 8/18 3.25s
#22 Gemini 3.1 Flash Lite Preview low Google 4 8.1 13/18 3.22s
#4 Claude Opus 4.7 none Anthropic 2 9.2 16/18 3.13s
#58 GLM 5V Turbo none Z.ai 8 6.2 8/18 3.10s
#77 GLM 5 Turbo none Z.ai 10 5.5 6/18 2.94s
#94 MiMo-V2-Flash none Xiaomi 12 4.5 3/18 2.79s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 9 6.8 9/18 2.60s

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল