ভুল উত্তর ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি ভুল উত্তর সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: ব্যর্থতার সংখ্যা ↑.

দেখানো মডেল

মোট ব্যর্থতা

1558

সবচেয়ে বেশি প্রভাবিত মডেল

Gemini 3 Flash Preview 1

বিভাগ

ডোমেইন-নির্দিষ্ট বিভাগে412 অ্যান্টি-এআই কৌশল বিভাগে293 কোডিং বিভাগে252 ধাঁধা সমাধান বিভাগে201 সাধারণ জ্ঞান বিভাগে168 সমন্বিত বিভাগে68 নির্দেশনা অনুসরণ বিভাগে61 Sadharon Buddhimotta বিভাগে59 ডেটা পার্সিং ও নিষ্কাশন বিভাগে41 টুল কলিং বিভাগে3

209/209

র‍্যাঙ্ক	মডেল	কোম্পানি	ভুল উত্তর সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#14	Claude Opus 4.8 medium	Anthropic	3	8.8	$1.931	18/22	12.5s
মোট টেস্ট 22 ভুল টেস্ট 4 মোট খরচ $1.931 প্রতিক্রিয়া সময় (গড়) 12.5s
#15	Claude Opus 4.7 medium	Anthropic	3	8.7	$1.477	18/22	7.61s
মোট টেস্ট 22 ভুল টেস্ট 4 মোট খরচ $1.477 প্রতিক্রিয়া সময় (গড়) 7.61s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.951 প্রতিক্রিয়া সময় (গড়) 22.6s
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.970 প্রতিক্রিয়া সময় (গড়) 62.7s
#38	GLM 5.2 medium	Z.ai	3	7.8	$0.222	15/21	23.3s
মোট টেস্ট 21 ভুল টেস্ট 6 মোট খরচ $0.222 প্রতিক্রিয়া সময় (গড়) 23.3s
#42	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
মোট টেস্ট 21 ভুল টেস্ট 6 মোট খরচ $0.307 প্রতিক্রিয়া সময় (গড়) 33.5s
#43	Claude Opus 4.6 medium	Anthropic	3	7.7	$3.059	13/22	34.3s
মোট টেস্ট 22 ভুল টেস্ট 9 মোট খরচ $3.059 প্রতিক্রিয়া সময় (গড়) 34.3s
#47	MiniMax M3 medium	Minimax	3	7.6	$0.286	12/22	75.0s
মোট টেস্ট 22 ভুল টেস্ট 10 মোট খরচ $0.286 প্রতিক্রিয়া সময় (গড়) 75.0s
#68	Kimi K2.6 medium	Moonshot AI	3	7.2	$1.036	12/22	110.0s
মোট টেস্ট 22 ভুল টেস্ট 10 মোট খরচ $1.036 প্রতিক্রিয়া সময় (গড়) 110.0s
#79	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
মোট টেস্ট 22 ভুল টেস্ট 7 মোট খরচ $1.079 প্রতিক্রিয়া সময় (গড়) 9.93s
#84	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
মোট টেস্ট 22 ভুল টেস্ট 10 মোট খরচ $0.187 প্রতিক্রিয়া সময় (গড়) 33.9s
#94	Claude Opus 4.7 none	Anthropic	3	6.6	$0.505	16/19	3.02s
মোট টেস্ট 19 ভুল টেস্ট 3 মোট খরচ $0.505 প্রতিক্রিয়া সময় (গড়) 3.02s
#95	Gemma 4 26B A4B medium	Google	3	6.6	$0.089	14/22	103.8s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.089 প্রতিক্রিয়া সময় (গড়) 103.8s
#100	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
মোট টেস্ট 21 ভুল টেস্ট 7 মোট খরচ $0.018 প্রতিক্রিয়া সময় (গড়) 16.3s
#131	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
মোট টেস্ট 18 ভুল টেস্ট 4 মোট খরচ $0.750 প্রতিক্রিয়া সময় (গড়) 9.75s

ভুল উত্তর ব্যর্থতা

মডেল ফিল্টার করুন

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল