کوڈنگ x غلط جواب درجہ بندی

AI BENCHY زمرہ ناکامیاں

دیکھیں کہ کوڈنگ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

کل ناکامیاں

230

سب سے زیادہ متاثر ماڈل

Qwen3.6 Flash 3

ناکامی کی وجوہات

غلط جواب230 API خرابی43 ٹائم آؤٹ23 کوئی جواب نہیں18 ہدایات پر عمل نہیں کیا16 اضافی فارمیٹنگ12

زمرے

ڈومین مخصوص367 اینٹی اے آئی چالیں270 کوڈنگ230 پہیلی حل کرنا172 معلومات عامہ149 مشترکہ58 ہدایات کی پیروی56 عمومی ذہانت49 ڈیٹا پارسنگ اور استخراج36 ٹول کالنگ3

134/134

درجہ	ماڈل	کمپنی	غلط جواب کی تعداد	زمرہ اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#152	Mistral Small 4 medium	Mistral	3	4.4	$0.068	0/3	40.0s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.068 ردِعمل کا وقت (اوسط) 40.0s
#154	Qwen3.5-9B none	Qwen	3	3.9	$0.006	0/3	5.60s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.006 ردِعمل کا وقت (اوسط) 5.60s
#158	GPT-4o-mini none	OpenAI	3	3.2	$0.006	0/3	1.63s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.006 ردِعمل کا وقت (اوسط) 1.63s
#160	GLM 4.7 Flash none	Z.ai	3	4.3	$0.004	0/3	2.54s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.004 ردِعمل کا وقت (اوسط) 2.54s
#161	Nemotron 3 Super none	NVIDIA	3	3.3	$0.006	0/3	2.64s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.006 ردِعمل کا وقت (اوسط) 2.64s
#164	GPT-5.4 Nano none	OpenAI	3	4.6	$0.011	0/3	2.22s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.011 ردِعمل کا وقت (اوسط) 2.22s
#170	Mercury 2 none	Inception	3	3.4	$0.011	0/3	1.03s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.011 ردِعمل کا وقت (اوسط) 1.03s
#34	Qwen3.5-27B medium	Qwen	2	6.2	$0.536	1/3	160.7s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.536 ردِعمل کا وقت (اوسط) 160.7s
#37	GPT-5.6 Terra medium	OpenAI	2	6.1	$0.496	1/3	7.19s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.496 ردِعمل کا وقت (اوسط) 7.19s
#40	Gemini 3.1 Flash Lite Preview medium	Google	2	5.5	$0.068	1/3	4.09s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.068 ردِعمل کا وقت (اوسط) 4.09s
#41	Qwen3.5 Plus 2026-04-20 medium	Qwen	2	6.2	$0.317	1/3	125.3s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.317 ردِعمل کا وقت (اوسط) 125.3s
#42	Gemini 3.1 Flash Lite medium	Google	2	5.5	$0.071	1/3	3.81s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.071 ردِعمل کا وقت (اوسط) 3.81s
#47	GPT-5.6 Terra low	OpenAI	2	6.6	$0.343	1/3	9.56s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.343 ردِعمل کا وقت (اوسط) 9.56s
#50	GPT-5.6 Luna high	OpenAI	2	5.5	$0.924	1/3	15.6s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.924 ردِعمل کا وقت (اوسط) 15.6s
#54	GPT-5.6 Luna medium	OpenAI	2	5.4	$0.258	1/3	10.4s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.258 ردِعمل کا وقت (اوسط) 10.4s

←

1 2 3 9

→

ماڈلز فلٹر کریں

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز

کوڈنگ: غلط جواب

ماڈلز فلٹر کریں

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز