ভুল উত্তর ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি ভুল উত্তর সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: সঠিক টেস্ট ↓.

দেখানো মডেল

মোট ব্যর্থতা

1585

সবচেয়ে বেশি প্রভাবিত মডেল

Gemini 3.6 Flash 1

বিভাগ

ডোমেইন-নির্দিষ্ট বিভাগে421 অ্যান্টি-এআই কৌশল বিভাগে293 কোডিং বিভাগে259 ধাঁধা সমাধান বিভাগে204 সাধারণ জ্ঞান বিভাগে172 সমন্বিত বিভাগে69 Sadharon Buddhimotta বিভাগে62 নির্দেশনা অনুসরণ বিভাগে61 ডেটা পার্সিং ও নিষ্কাশন বিভাগে41 টুল কলিং বিভাগে3

215/215

র‍্যাঙ্ক	মডেল	কোম্পানি	ভুল উত্তর সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	12	6.1	$0.122	8/22	13.6s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.122 প্রতিক্রিয়া সময় (গড়) 13.6s
#135	Nemotron 3 Ultra none	NVIDIA	12	6.1	$0.095	8/22	3.87s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.095 প্রতিক্রিয়া সময় (গড়) 3.87s
#138	GPT-5.6 Terra none	OpenAI	11	6.0	$0.349	8/22	1.65s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.349 প্রতিক্রিয়া সময় (গড়) 1.65s
#146	Nemotron 3 Super medium	NVIDIA	5	5.7	$0.055	8/22	52.0s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.055 প্রতিক্রিয়া সময় (গড়) 52.0s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	11	5.6	$0.048	8/22	8.42s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.048 প্রতিক্রিয়া সময় (গড়) 8.42s
#162	Gemma 4 26B A4B none	Google	10	5.5	$0.015	8/22	7.64s
মোট টেস্ট 22 ভুল টেস্ট 14 মোট খরচ $0.015 প্রতিক্রিয়া সময় (গড়) 7.64s
#153	Mimo V2 PRO none	Xiaomi	11	5.6	$0.045	7/21	2.27s
মোট টেস্ট 21 ভুল টেস্ট 14 মোট খরচ $0.045 প্রতিক্রিয়া সময় (গড়) 2.27s
#154	Owl Alpha none	Openrouter	10	5.6	$0.000	7/21	9.88s
মোট টেস্ট 21 ভুল টেস্ট 14 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 9.88s
#194	Cobuddy medium	Baidu	9	4.7	$0.000	7/21	39.9s
মোট টেস্ট 21 ভুল টেস্ট 14 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 39.9s
#197	Grok 4.20 Beta none	X AI	10	4.4	$0.087	6/18	1.19s
মোট টেস্ট 18 ভুল টেস্ট 12 মোট খরচ $0.087 প্রতিক্রিয়া সময় (গড়) 1.19s
#202	Hunter Alpha none	OpenRouter	9	4.2	$0.000	6/18	4.70s
মোট টেস্ট 18 ভুল টেস্ট 12 মোট খরচ $0.000 প্রতিক্রিয়া সময় (গড়) 4.70s
#203	Grok 4.20 none	X AI	10	4.1	$0.057	6/18	1.11s
মোট টেস্ট 18 ভুল টেস্ট 12 মোট খরচ $0.057 প্রতিক্রিয়া সময় (গড়) 1.11s
#117	LongCat 2.0 none	Meituan	14	6.3	$0.044	7/22	5.18s
মোট টেস্ট 22 ভুল টেস্ট 15 মোট খরচ $0.044 প্রতিক্রিয়া সময় (গড়) 5.18s
#130	Qwen3.6 Flash none	Qwen	12	6.1	$0.062	7/22	3.74s
মোট টেস্ট 22 ভুল টেস্ট 15 মোট খরচ $0.062 প্রতিক্রিয়া সময় (গড়) 3.74s
#133	Qwen3.5-35B-A3B none	Qwen	12	6.1	$0.106	7/22	12.7s
মোট টেস্ট 22 ভুল টেস্ট 15 মোট খরচ $0.106 প্রতিক্রিয়া সময় (গড়) 12.7s

ভুল উত্তর ব্যর্থতা

মডেল ফিল্টার করুন

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল