AI BENCHY
Your ad here

AI BENCHY ব্যর্থতা

নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: প্রতিক্রিয়া সময় (গড়) ↓.

দেখানো মডেল

5

মোট ব্যর্থতা

180

সবচেয়ে বেশি প্রভাবিত মডেল

Qwen3.5-9B 2
র‍্যাঙ্ক মডেল কোম্পানি নির্দেশনা অনুসরণ করা হয়নি সংখ্যা স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#82 Grok 4.20 none X AI 2 5.2 5/18 1.11s
#62 Gemini 2.5 Flash none Google 1 6.2 7/18 903ms
#98 LFM2-24B-A2B none Liquid 2 4.1 1/16 811ms
#83 Mistral Small 4 none Mistral 2 5.2 5/18 665ms
#91 Mercury 2 none Inception 1 4.8 4/18 613ms

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা অনুযায়ী শীর্ষ মডেল

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল