নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি নির্দেশনা অনুসরণ করা হয়নি সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: সঠিক টেস্ট ↑.

দেখানো মডেল

মোট ব্যর্থতা

246

সবচেয়ে বেশি প্রভাবিত মডেল

Granite 4.1 8B 4

বিভাগ

ধাঁধা সমাধান বিভাগে90 Sadharon Buddhimotta বিভাগে78 অ্যান্টি-এআই কৌশল বিভাগে33 নির্দেশনা অনুসরণ বিভাগে19 কোডিং বিভাগে16 টুল কলিং বিভাগে8 ডোমেইন-নির্দিষ্ট বিভাগে1 সমন্বিত বিভাগে1

141/141

র‍্যাঙ্ক	মডেল	কোম্পানি	নির্দেশনা অনুসরণ করা হয়নি সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#153	Mimo V2 PRO none	Xiaomi	2	5.6	$0.045	7/21	2.27s
মোট টেস্ট 21 ভুল টেস্ট 14 মোট খরচ $0.045 প্রতিক্রিয়া সময় (গড়) 2.27s
#154	Owl Alpha none	Openrouter	3	5.6	$0.000	7/21	9.88s
মোট টেস্ট 21 ভুল টেস্ট 14 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 9.88s
#194	Cobuddy medium	Baidu	3	4.7	$0.000	7/21	39.9s
মোট টেস্ট 21 ভুল টেস্ট 14 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 39.9s
#197	Grok 4.20 Beta none	X AI	1	4.4	$0.087	6/18	1.19s
মোট টেস্ট 18 ভুল টেস্ট 12 মোট খরচ $0.087 প্রতিক্রিয়া সময় (গড়) 1.19s
#202	Hunter Alpha none	OpenRouter	2	4.2	$0.000	6/18	4.70s
মোট টেস্ট 18 ভুল টেস্ট 12 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 4.70s
#109	Qwen3.5-27B none	Qwen	2	6.5	$0.090	8/22	4.76s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.090 প্রতিক্রিয়া সময় (গড়) 4.76s
#118	Claude Sonnet 5 none	Anthropic	1	6.3	$0.548	8/22	6.04s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.548 প্রতিক্রিয়া সময় (গড়) 6.04s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	2	6.1	$0.122	8/22	13.6s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.122 প্রতিক্রিয়া সময় (গড়) 13.6s
#135	Nemotron 3 Ultra none	NVIDIA	1	6.1	$0.095	8/22	3.87s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.095 প্রতিক্রিয়া সময় (গড়) 3.87s
#138	GPT-5.6 Terra none	OpenAI	1	6.0	$0.349	8/22	1.65s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.349 প্রতিক্রিয়া সময় (গড়) 1.65s
#146	Nemotron 3 Super medium	NVIDIA	3	5.7	$0.055	8/22	52.0s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.055 প্রতিক্রিয়া সময় (গড়) 52.0s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	1	5.6	$0.048	8/22	8.42s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.048 প্রতিক্রিয়া সময় (গড়) 8.42s
#162	Gemma 4 26B A4B none	Google	2	5.5	$0.015	8/22	7.64s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.015 প্রতিক্রিয়া সময় (গড়) 7.64s
#208	Grok Build 0.1 none	X AI	2	4.0	$0.547	7/19	28.7s
মোট টেস্ট 19 ভুল টেস্ট 12 মোট খরচ $0.547 প্রতিক্রিয়া সময় (গড়) 28.7s
#151	GLM 5V Turbo none	Z.ai	2	5.6	$0.052	8/21	2.99s
মোট টেস্ট 21 ভুল টেস্ট 13 মোট খরচ $0.052 প্রতিক্রিয়া সময় (গড়) 2.99s

নির্দেশনা অনুসরণ করা হয়নি ব্যর্থতা

মডেল ফিল্টার করুন

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা অনুযায়ী শীর্ষ মডেল

নির্দেশনা অনুসরণ করা হয়নি সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল