AI BENCHY
Your ad here

AI BENCHY ব্যর্থতা

নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: প্রতিক্রিয়া সময় (গড়) ↑.

দেখানো মডেল

15

মোট ব্যর্থতা

180

সবচেয়ে বেশি প্রভাবিত মডেল

Mercury 2 1
র‍্যাঙ্ক মডেল কোম্পানি নির্দেশনা অনুসরণ করা হয়নি সংখ্যা স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#91 Mercury 2 none Inception 1 4.8 4/18 613ms
#83 Mistral Small 4 none Mistral 2 5.2 5/18 665ms
#98 LFM2-24B-A2B none Liquid 2 4.1 1/16 811ms
#62 Gemini 2.5 Flash none Google 1 6.2 7/18 903ms
#82 Grok 4.20 none X AI 2 5.2 5/18 1.11s
#86 GPT-5.4 Mini none OpenAI 3 5.1 5/18 1.17s
#79 Grok 4.20 Beta none X AI 3 5.3 4/18 1.19s
#85 Elephant none Openrouter 3 5.2 5/18 1.23s
#81 Elephant medium Openrouter 3 5.2 5/18 1.27s
#29 Gemini 3.1 Flash Lite Preview none Google 2 7.9 12/18 1.30s
#96 GPT-5.4 Nano none OpenAI 3 4.5 2/18 1.40s
#90 Qwen3.5-9B none Qwen 3 4.8 4/18 1.47s
#66 GPT-5.4 none OpenAI 1 5.9 7/18 1.51s
#67 Qwen3.5-27B none Qwen 2 5.9 6/18 1.74s
#95 Grok 4.1 Fast none X AI 2 4.5 3/18 1.76s

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা অনুযায়ী শীর্ষ মডেল

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল