নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: প্রতিক্রিয়া সময় (গড়) ↓.

দেখানো মডেল

মোট ব্যর্থতা

246

সবচেয়ে বেশি প্রভাবিত মডেল

Step 3.5 Flash 3

বিভাগ

ধাঁধা সমাধান বিভাগে90 Sadharon Buddhimotta বিভাগে78 অ্যান্টি-এআই কৌশল বিভাগে33 নির্দেশনা অনুসরণ বিভাগে19 কোডিং বিভাগে16 টুল কলিং বিভাগে8 ডোমেইন-নির্দিষ্ট বিভাগে1 সমন্বিত বিভাগে1

141/141

র‍্যাঙ্ক	মডেল	কোম্পানি	নির্দেশনা অনুসরণ করা হয়নি সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#202	Hunter Alpha none	OpenRouter	2	4.2	$0.000	6/18	4.70s
মোট টেস্ট 18 ভুল টেস্ট 12 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 4.70s
#174	MiMo-V2.5 none	Xiaomi	1	5.1	$0.025	5/22	4.62s
মোট টেস্ট 22 ভুল টেস্ট 17 মোট খরচ $0.025 প্রতিক্রিয়া সময় (গড়) 4.62s
#68	Gemini 3.1 Flash Lite Preview medium	Google	1	7.3	$0.115	13/22	4.61s
মোট টেস্ট 22 ভুল টেস্ট 9 মোট খরচ $0.115 প্রতিক্রিয়া সময় (গড়) 4.61s
#69	Gemini 3.1 Flash Lite medium	Google	1	7.3	$0.117	13/22	4.27s
মোট টেস্ট 22 ভুল টেস্ট 9 মোট খরচ $0.117 প্রতিক্রিয়া সময় (গড়) 4.27s
#160	MiMo-V2.5-Pro none	Xiaomi	4	5.5	$0.068	6/22	4.12s
মোট টেস্ট 22 ভুল টেস্ট 16 মোট খরচ $0.068 প্রতিক্রিয়া সময় (গড়) 4.12s
#135	Nemotron 3 Ultra none	NVIDIA	1	6.1	$0.095	8/22	3.87s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.095 প্রতিক্রিয়া সময় (গড়) 3.87s
#130	Qwen3.6 Flash none	Qwen	1	6.1	$0.062	7/22	3.74s
মোট টেস্ট 22 ভুল টেস্ট 15 মোট খরচ $0.062 প্রতিক্রিয়া সময় (গড়) 3.74s
#170	Inkling none	Thinkingmachines	1	5.2	$0.147	6/22	3.50s
মোট টেস্ট 22 ভুল টেস্ট 16 মোট খরচ $0.147 প্রতিক্রিয়া সময় (গড়) 3.50s
#151	GLM 5V Turbo none	Z.ai	2	5.6	$0.052	8/21	2.99s
মোট টেস্ট 21 ভুল টেস্ট 13 মোট খরচ $0.052 প্রতিক্রিয়া সময় (গড়) 2.99s
#189	Trinity Large Preview none	Arcee AI	3	4.8	$0.008	4/21	2.98s
মোট টেস্ট 21 ভুল টেস্ট 17 মোট খরচ $0.008 প্রতিক্রিয়া সময় (গড়) 2.98s
#176	GLM 5 Turbo none	Z.ai	2	5.1	$0.047	6/21	2.82s
মোট টেস্ট 21 ভুল টেস্ট 15 মোট খরচ $0.047 প্রতিক্রিয়া সময় (গড়) 2.82s
#206	MiMo-V2-Flash none	Xiaomi	2	4.0	$0.025	4/21	2.76s
মোট টেস্ট 21 ভুল টেস্ট 17 মোট খরচ $0.025 প্রতিক্রিয়া সময় (গড়) 2.76s
#82	Mercury 2 medium	Inception	3	7.0	$0.093	10/22	2.72s
মোট টেস্ট 22 ভুল টেস্ট 12 মোট খরচ $0.093 প্রতিক্রিয়া সময় (গড়) 2.72s
#92	Gemini 3.5 Flash minimal	Google	1	6.8	$0.300	14/22	2.65s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.300 প্রতিক্রিয়া সময় (গড়) 2.65s
#186	GPT-5.4 Nano none	OpenAI	2	4.8	$0.041	4/22	2.57s
মোট টেস্ট 22 ভুল টেস্ট 18 মোট খরচ $0.041 প্রতিক্রিয়া সময় (গড়) 2.57s

নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা

মডেল ফিল্টার করুন

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা অনুযায়ী শীর্ষ মডেল

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল