AI BENCHY
Your ad here

AI BENCHY ব্যর্থতা

ভুল উত্তর ব্যর্থতা

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি ভুল উত্তর সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: স্কোর ↑.

দেখানো মডেল

7

মোট ব্যর্থতা

572

সবচেয়ে বেশি প্রভাবিত মডেল

LFM2-24B-A2B 9
র‍্যাঙ্ক মডেল কোম্পানি ভুল উত্তর সংখ্যা স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#8 Qwen3.5 Plus 2026-02-15 medium Qwen 2 8.5 14/18 46.6s
#7 GPT-5.3-Codex medium OpenAI 3 8.6 13/18 15.4s
#6 Seed-2.0-Lite medium Bytedance Seed 3 8.6 13/18 30.4s
#5 Gemini 3 Flash Preview low Google 3 8.8 15/18 6.01s
#4 Claude Opus 4.7 none Anthropic 2 9.2 16/18 3.13s
#3 Claude Opus 4.7 medium Anthropic 1 9.2 16/18 3.53s
#2 Gemini 3.1 Pro Preview medium Google 1 9.6 17/18 16.0s

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল