নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: স্কোর ↑.

দেখানো মডেল

মোট ব্যর্থতা

245

সবচেয়ে বেশি প্রভাবিত মডেল

LFM2-24B-A2B 1

বিভাগ

ধাঁধা সমাধান বিভাগে90 Sadharon Buddhimotta বিভাগে78 অ্যান্টি-এআই কৌশল বিভাগে33 নির্দেশনা অনুসরণ বিভাগে18 কোডিং বিভাগে16 টুল কলিং বিভাগে8 ডোমেইন-নির্দিষ্ট বিভাগে1 সমন্বিত বিভাগে1

140/140

র‍্যাঙ্ক	মডেল	কোম্পানি	নির্দেশনা অনুসরণ করা হয়নি সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#193	Elephant Alpha none	Openrouter	3	4.3	$0.000	5/21	1.22s
মোট টেস্ট 21 ভুল টেস্ট 16 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 1.22s
#191	Grok 4.20 Beta none	X AI	1	4.4	$0.087	6/18	1.19s
মোট টেস্ট 18 ভুল টেস্ট 12 মোট খরচ $0.087 প্রতিক্রিয়া সময় (গড়) 1.19s
#190	MiniMax M2.5 medium	Minimax	3	4.6	$0.340	5/22	68.3s
মোট টেস্ট 22 ভুল টেস্ট 17 মোট খরচ $0.340 প্রতিক্রিয়া সময় (গড়) 68.3s
#189	Mercury 2 none	Inception	1	4.6	$0.030	4/22	829ms
মোট টেস্ট 22 ভুল টেস্ট 18 মোট খরচ $0.030 প্রতিক্রিয়া সময় (গড়) 829ms
#188	Cobuddy medium	Baidu	3	4.7	$0.000	7/21	39.9s
মোট টেস্ট 21 ভুল টেস্ট 14 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 39.9s
#187	Qwen3 Coder Next medium	Qwen	3	4.7	$0.032	4/22	9.61s
মোট টেস্ট 22 ভুল টেস্ট 18 মোট খরচ $0.032 প্রতিক্রিয়া সময় (গড়) 9.61s
#186	Laguna M.1 medium	Poolside	1	4.7	$0.033	9/19	14.7s
মোট টেস্ট 19 ভুল টেস্ট 10 মোট খরচ $0.033 প্রতিক্রিয়া সময় (গড়) 14.7s
#185	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
মোট টেস্ট 19 ভুল টেস্ট 10 মোট খরচ $0.069 প্রতিক্রিয়া সময় (গড়) 23.8s
#184	Hunter Alpha medium	OpenRouter	2	4.7	$0.000	8/18	10.3s
মোট টেস্ট 18 ভুল টেস্ট 10 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 10.3s
#183	Trinity Large Preview none	Arcee AI	3	4.8	$0.008	4/21	2.98s
মোট টেস্ট 21 ভুল টেস্ট 17 মোট খরচ $0.008 প্রতিক্রিয়া সময় (গড়) 2.98s
#181	Grok 4.20 Multi Agent Beta medium	X AI	2	4.8	$5.599	8/18	9.69s
মোট টেস্ট 18 ভুল টেস্ট 10 মোট খরচ $5.599 প্রতিক্রিয়া সময় (গড়) 9.69s
#180	GPT-5.4 Nano none	OpenAI	2	4.8	$0.041	4/22	2.57s
মোট টেস্ট 22 ভুল টেস্ট 18 মোট খরচ $0.041 প্রতিক্রিয়া সময় (গড়) 2.57s
#179	Ring-2.6-1T none	Inclusionai	2	4.8	$0.026	9/22	55.1s
মোট টেস্ট 22 ভুল টেস্ট 13 মোট খরচ $0.026 প্রতিক্রিয়া সময় (গড়) 55.1s
#178	Ling-2.6-flash none	Inclusionai	2	4.9	$0.002	6/22	10.7s
মোট টেস্ট 22 ভুল টেস্ট 16 মোট খরচ $0.002 প্রতিক্রিয়া সময় (গড়) 10.7s
#177	Nemotron 3 Super none	NVIDIA	2	4.9	$0.008	5/22	5.97s
মোট টেস্ট 22 ভুল টেস্ট 17 মোট খরচ $0.008 প্রতিক্রিয়া সময় (গড়) 5.97s

নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা

মডেল ফিল্টার করুন

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা অনুযায়ী শীর্ষ মডেল

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল