AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY ব্যর্থতা

নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: সঠিক টেস্ট ↓.

দেখানো মডেল

15

মোট ব্যর্থতা

215

সবচেয়ে বেশি প্রভাবিত মডেল

Gemini 3.5 Flash 1
র‍্যাঙ্ক মডেল কোম্পানি নির্দেশনা অনুসরণ করা হয়নি সংখ্যা স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#31 DeepSeek V4 Flash high DeepSeek 2 7.7 13/21 45.8s
#38 Grok 4.3 medium X AI 2 7.6 13/21 47.5s
#40 Gemini 3.1 Flash Lite Preview medium Google 1 7.5 13/21 3.96s
#42 GPT-5.2 medium OpenAI 3 7.5 13/21 16.9s
#44 Gemini 3.1 Flash Lite medium Google 1 7.5 13/21 3.23s
#46 Qwen3.6 35B A3B medium Qwen 1 7.4 13/21 18.1s
#50 Gemini 3.1 Flash Lite Preview low Google 1 7.4 13/21 2.77s
#39 Qwen3.6 Flash medium Qwen 1 7.5 12/21 19.2s
#43 MiMo-V2.5-Pro medium Xiaomi 2 7.5 12/21 26.1s
#45 GPT-5.4 Mini medium OpenAI 3 7.5 12/21 22.3s
#49 Qwen3.5-Flash medium Qwen 1 7.4 12/21 63.3s
#51 Mimo V2 PRO medium Xiaomi 1 7.4 12/21 22.2s
#54 GPT-5 Mini medium OpenAI 3 7.3 12/21 23.6s
#56 MiMo-V2.5 medium Xiaomi 1 7.3 12/21 27.1s
#58 Gemini 3.1 Flash Lite Preview none Google 2 7.2 12/21 1.21s

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা অনুযায়ী শীর্ষ মডেল

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল