AI BENCHY
Your ad here

AI BENCHY বিভাগীয় ব্যর্থতা

ধাঁধা সমাধান: ভুল উত্তর

ধাঁধা সমাধান
ভুল উত্তর

দেখুন ধাঁধা সমাধান এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়।

দেখানো মডেল

15

মোট ব্যর্থতা

85

সবচেয়ে বেশি প্রভাবিত মডেল

Kimi K2.5 3
র‍্যাঙ্ক মডেল কোম্পানি ভুল উত্তর সংখ্যা বিভাগ স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#46 Kimi K2.5 medium Moonshot AI 1 5.3 1/3 45.4s
#48 Gemma 4 31B none Google 1 5.5 1/3 2.95s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 1 7.7 2/3 2.82s
#50 Hunter Alpha medium OpenRouter 1 6.1 1/3 5.36s
#51 Nemotron 3 Super medium NVIDIA 1 3.5 0/3 8.39s
#52 Grok 4.1 Fast medium X AI 1 5.3 1/3 8.08s
#53 GLM 5 none Z.ai 1 7.7 2/3 2.05s
#54 Mercury 2 medium Inception 1 3.9 0/3 934ms
#57 GPT-5 Nano medium OpenAI 1 5.3 1/3 19.8s
#58 GLM 5V Turbo none Z.ai 1 5.3 1/3 2.22s
#60 Gemma 4 26B A4B none Google 1 5.7 1/3 739ms
#62 Gemini 2.5 Flash none Google 1 5.7 1/3 576ms
#64 DeepSeek V3.2 none DeepSeek 1 8.5 2/3 7.37s
#65 MiMo-V2-Pro none Xiaomi 1 6.0 1/3 1.83s
#66 GPT-5.4 none OpenAI 1 5.6 1/3 1.52s

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল

আনুমানিক অপচয় হওয়া খরচ অনুযায়ী শীর্ষ মডেল