ভুল উত্তর ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি ভুল উত্তর সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: স্কোর ↑.

দেখানো মডেল

মোট ব্যর্থতা

1585

সবচেয়ে বেশি প্রভাবিত মডেল

LFM2-24B-A2B 9

বিভাগ

ডোমেইন-নির্দিষ্ট বিভাগে421 অ্যান্টি-এআই কৌশল বিভাগে293 কোডিং বিভাগে259 ধাঁধা সমাধান বিভাগে204 সাধারণ জ্ঞান বিভাগে172 সমন্বিত বিভাগে69 Sadharon Buddhimotta বিভাগে62 নির্দেশনা অনুসরণ বিভাগে61 ডেটা পার্সিং ও নিষ্কাশন বিভাগে41 টুল কলিং বিভাগে3

215/215

র‍্যাঙ্ক	মডেল	কোম্পানি	ভুল উত্তর সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#96	LongCat 2.0 low	Meituan	8	6.7	$0.391	10/22	100.3s
মোট টেস্ট 22 ভুল টেস্ট 12 মোট খরচ $0.391 প্রতিক্রিয়া সময় (গড়) 100.3s
#95	Gemini 3.5 Flash-Lite low	Google	9	6.7	$0.145	12/22	2.25s
মোট টেস্ট 22 ভুল টেস্ট 10 মোট খরচ $0.145 প্রতিক্রিয়া সময় (গড়) 2.25s
#94	Qwen3.6 35B A3B medium	Qwen	4	6.7	$0.746	13/22	58.1s
মোট টেস্ট 22 ভুল টেস্ট 9 মোট খরচ $0.746 প্রতিক্রিয়া সময় (গড়) 58.1s
#93	Gemini 3 Flash Preview none	Google	8	6.8	$0.085	13/22	2.95s
মোট টেস্ট 22 ভুল টেস্ট 9 মোট খরচ $0.085 প্রতিক্রিয়া সময় (গড়) 2.95s
#92	Gemini 3.5 Flash minimal	Google	5	6.8	$0.300	14/22	2.65s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.300 প্রতিক্রিয়া সময় (গড়) 2.65s
#91	GPT-5.5 none	OpenAI	11	6.9	$0.544	11/22	2.36s
মোট টেস্ট 22 ভুল টেস্ট 11 মোট খরচ $0.544 প্রতিক্রিয়া সময় (গড়) 2.36s
#90	Step 3.7 Flash high	Stepfun	6	6.9	$1.207	11/22	64.7s
মোট টেস্ট 22 ভুল টেস্ট 11 মোট খরচ $1.207 প্রতিক্রিয়া সময় (গড়) 64.7s
#89	Qwen3.6 Flash medium	Qwen	8	6.9	$0.738	12/22	44.7s
মোট টেস্ট 22 ভুল টেস্ট 10 মোট খরচ $0.738 প্রতিক্রিয়া সময় (গড়) 44.7s
#88	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
মোট টেস্ট 22 ভুল টেস্ট 10 মোট খরচ $0.187 প্রতিক্রিয়া সময় (গড়) 33.9s
#87	GPT-5.6 Sol none	OpenAI	10	6.9	$0.524	11/22	2.16s
মোট টেস্ট 22 ভুল টেস্ট 11 মোট খরচ $0.524 প্রতিক্রিয়া সময় (গড়) 2.16s
#86	DeepSeek V4 Pro none	DeepSeek	8	6.9	$0.096	10/22	11.6s
মোট টেস্ট 22 ভুল টেস্ট 12 মোট খরচ $0.096 প্রতিক্রিয়া সময় (গড়) 11.6s
#85	KAT-Coder-Pro V2.5 medium	Kwaipilot	9	6.9	$0.467	11/22	24.0s
মোট টেস্ট 22 ভুল টেস্ট 11 মোট খরচ $0.467 প্রতিক্রিয়া সময় (গড়) 24.0s
#84	Seed-2.0-Mini medium	Bytedance Seed	4	7.0	$0.101	11/22	92.5s
মোট টেস্ট 22 ভুল টেস্ট 11 মোট খরচ $0.101 প্রতিক্রিয়া সময় (গড়) 92.5s
#83	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
মোট টেস্ট 22 ভুল টেস্ট 7 মোট খরচ $1.079 প্রতিক্রিয়া সময় (গড়) 9.93s
#82	Mercury 2 medium	Inception	8	7.0	$0.093	10/22	2.72s
মোট টেস্ট 22 ভুল টেস্ট 12 মোট খরচ $0.093 প্রতিক্রিয়া সময় (গড়) 2.72s

ভুল উত্তর ব্যর্থতা

মডেল ফিল্টার করুন

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল