নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: প্রতিক্রিয়া সময় (গড়) ↑.

দেখানো মডেল

মোট ব্যর্থতা

246

সবচেয়ে বেশি প্রভাবিত মডেল

Nemotron 3 Nano Omni 30b A3b Reasoning 2

বিভাগ

ধাঁধা সমাধান বিভাগে90 Sadharon Buddhimotta বিভাগে78 অ্যান্টি-এআই কৌশল বিভাগে33 নির্দেশনা অনুসরণ বিভাগে19 কোডিং বিভাগে16 টুল কলিং বিভাগে8 ডোমেইন-নির্দিষ্ট বিভাগে1 সমন্বিত বিভাগে1

141/141

র‍্যাঙ্ক	মডেল	কোম্পানি	নির্দেশনা অনুসরণ করা হয়নি সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#162	Gemma 4 26B A4B none	Google	2	5.5	$0.015	8/22	7.64s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.015 প্রতিক্রিয়া সময় (গড়) 7.64s
#34	GPT-5.2 Chat none	OpenAI	1	8.0	$0.604	14/22	7.65s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.604 প্রতিক্রিয়া সময় (গড়) 7.65s
#67	Claude Sonnet 4.6 none	Anthropic	1	7.3	$0.661	12/22	8.12s
মোট টেস্ট 22 ভুল টেস্ট 10 মোট খরচ $0.661 প্রতিক্রিয়া সময় (গড়) 8.12s
#12	Gemini 3.5 Flash medium	Google	1	9.1	$0.642	19/22	8.20s
মোট টেস্ট 22 ভুল টেস্ট 3 মোট খরচ $0.642 প্রতিক্রিয়া সময় (গড়) 8.20s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	1	5.6	$0.048	8/22	8.42s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.048 প্রতিক্রিয়া সময় (গড়) 8.42s
#168	Ling-2.6-1T none	Inclusionai	2	5.3	$0.016	4/22	8.58s
মোট টেস্ট 22 ভুল টেস্ট 18 মোট খরচ $0.016 প্রতিক্রিয়া সময় (গড়) 8.58s
#172	Qwen3 Coder Next none	Qwen	1	5.1	$0.025	5/22	9.12s
মোট টেস্ট 22 ভুল টেস্ট 17 মোট খরচ $0.025 প্রতিক্রিয়া সময় (গড়) 9.12s
#182	GLM 4.7 Flash none	Z.ai	1	4.9	$0.016	6/22	9.15s
মোট টেস্ট 22 ভুল টেস্ট 16 মোট খরচ $0.016 প্রতিক্রিয়া সময় (গড়) 9.15s
#101	GLM 5.2 none	Z.ai	1	6.6	$0.128	12/22	9.34s
মোট টেস্ট 22 ভুল টেস্ট 10 মোট খরচ $0.128 প্রতিক্রিয়া সময় (গড়) 9.34s
#31	Gemini 3.5 Flash-Lite high	Google	1	8.1	$0.584	14/22	9.48s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.584 প্রতিক্রিয়া সময় (গড়) 9.48s
#193	Qwen3 Coder Next medium	Qwen	3	4.7	$0.032	4/22	9.61s
মোট টেস্ট 22 ভুল টেস্ট 18 মোট খরচ $0.032 প্রতিক্রিয়া সময় (গড়) 9.61s
#187	Grok 4.20 Multi Agent Beta medium	X AI	2	4.8	$5.599	8/18	9.69s
মোট টেস্ট 18 ভুল টেস্ট 10 মোট খরচ $5.599 প্রতিক্রিয়া সময় (গড়) 9.69s
#137	Grok 4.20 Beta medium	X AI	1	6.0	$0.750	14/18	9.75s
মোট টেস্ট 18 ভুল টেস্ট 4 মোট খরচ $0.750 প্রতিক্রিয়া সময় (গড়) 9.75s
#154	Owl Alpha none	Openrouter	3	5.6	$0.000	7/21	9.88s
মোট টেস্ট 21 ভুল টেস্ট 14 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 9.88s
#164	KAT-Coder-Air V2.5 low	Kwaipilot	2	5.4	$0.041	7/22	10.1s
মোট টেস্ট 22 ভুল টেস্ট 15 মোট খরচ $0.041 প্রতিক্রিয়া সময় (গড়) 10.1s

নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা

মডেল ফিল্টার করুন

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা অনুযায়ী শীর্ষ মডেল

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল