ভুল উত্তর ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি ভুল উত্তর সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন।

দেখানো মডেল

মোট ব্যর্থতা

1558

সবচেয়ে বেশি প্রভাবিত মডেল

বিভাগ

ডোমেইন-নির্দিষ্ট বিভাগে412 অ্যান্টি-এআই কৌশল বিভাগে293 কোডিং বিভাগে252 ধাঁধা সমাধান বিভাগে201 সাধারণ জ্ঞান বিভাগে168 সমন্বিত বিভাগে68 নির্দেশনা অনুসরণ বিভাগে61 Sadharon Buddhimotta বিভাগে59 ডেটা পার্সিং ও নিষ্কাশন বিভাগে41 টুল কলিং বিভাগে3

209/209

র‍্যাঙ্ক	মডেল	কোম্পানি	ভুল উত্তর সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#136	GPT-5.4 Mini none	OpenAI	13	5.9	$0.095	6/22	1.53s
মোট টেস্ট 22 ভুল টেস্ট 16 মোট খরচ $0.095 প্রতিক্রিয়া সময় (গড়) 1.53s
#142	Qwen3.5-122B-A10B none	Qwen	13	5.7	$0.247	6/22	12.9s
মোট টেস্ট 22 ভুল টেস্ট 16 মোট খরচ $0.247 প্রতিক্রিয়া সময় (গড়) 12.9s
#151	GLM 5.1 none	Z.ai	13	5.5	$0.164	7/22	6.70s
মোট টেস্ট 22 ভুল টেস্ট 15 মোট খরচ $0.164 প্রতিক্রিয়া সময় (গড়) 6.70s
#161	Qwen3.6 35B A3B none	Qwen	13	5.3	$0.061	4/22	5.52s
মোট টেস্ট 22 ভুল টেস্ট 18 মোট খরচ $0.061 প্রতিক্রিয়া সময় (গড়) 5.52s
#164	Inkling none	Thinkingmachines	13	5.2	$0.147	6/22	3.50s
মোট টেস্ট 22 ভুল টেস্ট 16 মোট খরচ $0.147 প্রতিক্রিয়া সময় (গড়) 3.50s
#170	GLM 5 Turbo none	Z.ai	13	5.1	$0.047	6/21	2.82s
মোট টেস্ট 21 ভুল টেস্ট 15 মোট খরচ $0.047 প্রতিক্রিয়া সময় (গড়) 2.82s
#176	GLM 4.7 Flash none	Z.ai	13	4.9	$0.016	6/22	9.15s
মোট টেস্ট 22 ভুল টেস্ট 16 মোট খরচ $0.016 প্রতিক্রিয়া সময় (গড়) 9.15s
#182	KAT-Coder-Air V2.5 none	Kwaipilot	13	4.8	$0.067	5/22	12.2s
মোট টেস্ট 22 ভুল টেস্ট 17 মোট খরচ $0.067 প্রতিক্রিয়া সময় (গড়) 12.2s
#187	Qwen3 Coder Next medium	Qwen	13	4.7	$0.032	4/22	9.61s
মোট টেস্ট 22 ভুল টেস্ট 18 মোট খরচ $0.032 প্রতিক্রিয়া সময় (গড়) 9.61s
#200	MiMo-V2-Flash none	Xiaomi	13	4.0	$0.025	4/21	2.76s
মোট টেস্ট 21 ভুল টেস্ট 17 মোট খরচ $0.025 প্রতিক্রিয়া সময় (গড়) 2.76s
#201	Granite 4.1 8B none	IBM Granite	13	4.0	$0.007	2/22	1.45s
মোট টেস্ট 22 ভুল টেস্ট 20 মোট খরচ $0.007 প্রতিক্রিয়া সময় (গড়) 1.45s
#203	Grok 4.1 Fast none	X AI	13	3.8	$0.008	3/19	1.62s
মোট টেস্ট 19 ভুল টেস্ট 16 মোট খরচ $0.008 প্রতিক্রিয়া সময় (গড়) 1.62s
#103	Qwen3.5-27B none	Qwen	12	6.5	$0.090	8/22	4.76s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.090 প্রতিক্রিয়া সময় (গড়) 4.76s
#107	Qwen3.5 Plus 2026-02-15 none	Qwen	12	6.4	$0.073	10/22	9.85s
মোট টেস্ট 22 ভুল টেস্ট 12 মোট খরচ $0.073 প্রতিক্রিয়া সময় (গড়) 9.85s
#118	Gemini 2.5 Flash none	Google	12	6.2	$0.017	9/22	6.20s
মোট টেস্ট 22 ভুল টেস্ট 13 মোট খরচ $0.017 প্রতিক্রিয়া সময় (গড়) 6.20s

ভুল উত্তর ব্যর্থতা

মডেল ফিল্টার করুন

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল