AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY বিভাগীয় ব্যর্থতা

অ্যান্টি-এআই কৌশল: ভুল উত্তর

অ্যান্টি-এআই কৌশল
ভুল উত্তর

দেখুন অ্যান্টি-এআই কৌশল এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: ব্যর্থতার সংখ্যা ↑.

দেখানো মডেল

15

মোট ব্যর্থতা

165

সবচেয়ে বেশি প্রভাবিত মডেল

Claude Opus 4.7 1
র‍্যাঙ্ক মডেল কোম্পানি ভুল উত্তর সংখ্যা বিভাগ স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#3 Claude Opus 4.7 medium Anthropic 1 8.3 3/4 1.85s
#4 Claude Opus 4.7 none Anthropic 1 8.3 3/4 2.12s
#6 Seed-2.0-Lite medium Bytedance Seed 1 8.3 3/4 18.0s
#7 GPT-5.3-Codex medium OpenAI 1 8.7 3/4 4.16s
#8 Qwen3.5 Plus 2026-02-15 medium Qwen 1 8.2 3/4 45.8s
#15 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#16 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#21 Gemini 3 Flash Preview none Google 1 8.3 3/4 1.25s
#22 Gemini 3.1 Flash Lite Preview low Google 1 8.3 3/4 2.12s
#25 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#26 Claude Sonnet 4.6 medium Anthropic 1 6.5 2/4 2.98s
#27 DeepSeek V3.2 medium DeepSeek 1 8.4 3/4 30.7s
#28 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#29 Gemini 3.1 Flash Lite Preview none Google 1 7.5 2/4 1.04s
#31 GLM 5V Turbo medium Z.ai 1 7.2 2/4 10.8s

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল

আনুমানিক অপচয় হওয়া খরচ অনুযায়ী শীর্ষ মডেল