ভুল উত্তর ব্যর্থতা র‌্যাঙ্কিং

দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি ভুল উত্তর সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: স্কোর ↓.

দেখানো মডেল

মোট ব্যর্থতা

1558

সবচেয়ে বেশি প্রভাবিত মডেল

Gemini 3 Flash Preview 1

বিভাগ

ডোমেইন-নির্দিষ্ট বিভাগে412 অ্যান্টি-এআই কৌশল বিভাগে293 কোডিং বিভাগে252 ধাঁধা সমাধান বিভাগে201 সাধারণ জ্ঞান বিভাগে168 সমন্বিত বিভাগে68 নির্দেশনা অনুসরণ বিভাগে61 Sadharon Buddhimotta বিভাগে59 ডেটা পার্সিং ও নিষ্কাশন বিভাগে41 টুল কলিং বিভাগে3

209/209

র‍্যাঙ্ক	মডেল	কোম্পানি	ভুল উত্তর সংখ্যা	স্কোর	মোট খরচ	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.970 প্রতিক্রিয়া সময় (গড়) 62.7s
#32	Inkling medium	Thinkingmachines	4	8.0	$0.391	15/22	16.2s
মোট টেস্ট 22 ভুল টেস্ট 7 মোট খরচ $0.391 প্রতিক্রিয়া সময় (গড়) 16.2s
#34	GPT-5.6 Terra high	OpenAI	7	8.0	$1.055	14/22	11.3s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $1.055 প্রতিক্রিয়া সময় (গড়) 11.3s
#35	Seed-2.0-Lite medium	Bytedance Seed	5	7.9	$0.234	14/22	48.5s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.234 প্রতিক্রিয়া সময় (গড়) 48.5s
#36	Qwen3.7 Plus medium	Qwen	5	7.9	$0.267	15/22	51.5s
মোট টেস্ট 22 ভুল টেস্ট 7 মোট খরচ $0.267 প্রতিক্রিয়া সময় (গড়) 51.5s
#37	Qwen3.6 Plus medium	Qwen	5	7.8	$0.405	15/22	43.1s
মোট টেস্ট 22 ভুল টেস্ট 7 মোট খরচ $0.405 প্রতিক্রিয়া সময় (গড়) 43.1s
#38	GLM 5.2 medium	Z.ai	3	7.8	$0.222	15/21	23.3s
মোট টেস্ট 21 ভুল টেস্ট 6 মোট খরচ $0.222 প্রতিক্রিয়া সময় (গড়) 23.3s
#39	GPT-5.6 Terra medium	OpenAI	8	7.8	$0.676	14/22	7.11s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $0.676 প্রতিক্রিয়া সময় (গড়) 7.11s
#40	Claude Sonnet 4.6 medium	Anthropic	4	7.8	$2.057	14/22	25.9s
মোট টেস্ট 22 ভুল টেস্ট 8 মোট খরচ $2.057 প্রতিক্রিয়া সময় (গড়) 25.9s
#41	Claude Opus 4.8 low	Anthropic	4	7.8	$2.077	16/22	12.7s
মোট টেস্ট 22 ভুল টেস্ট 6 মোট খরচ $2.077 প্রতিক্রিয়া সময় (গড়) 12.7s
#42	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
মোট টেস্ট 21 ভুল টেস্ট 6 মোট খরচ $0.307 প্রতিক্রিয়া সময় (গড়) 33.5s
#43	Claude Opus 4.6 medium	Anthropic	3	7.7	$3.059	13/22	34.3s
মোট টেস্ট 22 ভুল টেস্ট 9 মোট খরচ $3.059 প্রতিক্রিয়া সময় (গড়) 34.3s
#44	GPT-5.6 Luna high	OpenAI	7	7.7	$1.017	15/22	18.7s
মোট টেস্ট 22 ভুল টেস্ট 7 মোট খরচ $1.017 প্রতিক্রিয়া সময় (গড়) 18.7s
#45	DeepSeek V4 Flash high	DeepSeek	6	7.7	$0.042	13/22	49.7s
মোট টেস্ট 22 ভুল টেস্ট 9 মোট খরচ $0.042 প্রতিক্রিয়া সময় (গড়) 49.7s
#46	DeepSeek V4 Pro high	DeepSeek	6	7.7	$0.200	10/22	79.1s
মোট টেস্ট 22 ভুল টেস্ট 12 মোট খরচ $0.200 প্রতিক্রিয়া সময় (গড়) 79.1s

ভুল উত্তর ব্যর্থতা

মডেল ফিল্টার করুন

ভুল উত্তর সংখ্যা অনুযায়ী শীর্ষ মডেল

ভুল উত্তর সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল