کوڈنگ x غلط جواب درجہ بندی

AI BENCHY زمرہ ناکامیاں

دیکھیں کہ کوڈنگ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

کل ناکامیاں

230

سب سے زیادہ متاثر ماڈل

Laguna XS 2.1 3

ناکامی کی وجوہات

غلط جواب230 API خرابی43 ٹائم آؤٹ23 کوئی جواب نہیں18 ہدایات پر عمل نہیں کیا16 اضافی فارمیٹنگ12

زمرے

ڈومین مخصوص367 اینٹی اے آئی چالیں270 کوڈنگ230 پہیلی حل کرنا172 معلومات عامہ149 مشترکہ58 ہدایات کی پیروی56 عمومی ذہانت49 ڈیٹا پارسنگ اور استخراج36 ٹول کالنگ3

134/134

درجہ	ماڈل	کمپنی	غلط جواب کی تعداد	زمرہ اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#141	Laguna XS 2.1 none	Poolside	3	4.3	$0.003	0/3	623ms
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.003 ردِعمل کا وقت (اوسط) 623ms
#108	Gemini 2.5 Flash none	Google	2	5.5	$0.016	1/3	736ms
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.016 ردِعمل کا وقت (اوسط) 736ms
#182	Granite 4.1 8B none	IBM Granite	1	4.5	$0.003	0/3	775ms
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.003 ردِعمل کا وقت (اوسط) 775ms
#109	Gemini 3.1 Flash Lite minimal	Google	2	5.5	$0.013	1/3	831ms
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.013 ردِعمل کا وقت (اوسط) 831ms
#112	Qwen3.5-Flash none	Qwen	2	5.5	$0.005	1/3	850ms
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.005 ردِعمل کا وقت (اوسط) 850ms
#148	Mistral Small 4 none	Mistral	3	3.7	$0.007	0/3	901ms
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.007 ردِعمل کا وقت (اوسط) 901ms
#143	GPT-5.4 Mini none	OpenAI	2	5.5	$0.038	1/3	913ms
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.038 ردِعمل کا وقت (اوسط) 913ms
#167	Qwen3 Coder Next medium	Qwen	2	3.7	$0.008	0/3	924ms
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.008 ردِعمل کا وقت (اوسط) 924ms
#111	Gemini 3.1 Flash Lite none	Google	2	5.5	$0.013	1/3	938ms
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.013 ردِعمل کا وقت (اوسط) 938ms
#97	Gemini 3.1 Flash Lite Preview none	Google	2	5.5	$0.018	1/3	967ms
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.018 ردِعمل کا وقت (اوسط) 967ms
#142	GPT-5.6 Luna none	OpenAI	3	3.8	$0.047	0/3	980ms
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.047 ردِعمل کا وقت (اوسط) 980ms
#116	GPT-5.6 Terra none	OpenAI	2	5.5	$0.130	1/3	1.00s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.130 ردِعمل کا وقت (اوسط) 1.00s
#114	Nemotron 3 Ultra 550b A55b none	NVIDIA	2	5.5	$0.027	1/3	1.02s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.027 ردِعمل کا وقت (اوسط) 1.02s
#170	Mercury 2 none	Inception	3	3.4	$0.011	0/3	1.03s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.011 ردِعمل کا وقت (اوسط) 1.03s
#168	Grok 4.20 Beta none	X AI	1	1.8	$0.087	0/1	1.14s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.087 ردِعمل کا وقت (اوسط) 1.14s

ماڈلز فلٹر کریں

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز

کوڈنگ: غلط جواب

ماڈلز فلٹر کریں

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز