کوڈنگ x ہدایات پر عمل نہیں کیا درجہ بندی

AI BENCHY زمرہ ناکامیاں

دیکھیں کہ کوڈنگ میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ناکامیوں کی تعداد ↑.

دکھائے گئے ماڈلز

کل ناکامیاں

سب سے زیادہ متاثر ماڈل

Gemini 3.5 Flash 1

ناکامی کی وجوہات

غلط جواب230 API خرابی43 ٹائم آؤٹ23 کوئی جواب نہیں18 ہدایات پر عمل نہیں کیا16 اضافی فارمیٹنگ12

زمرے

پہیلی حل کرنا82 عمومی ذہانت74 اینٹی اے آئی چالیں31 کوڈنگ16 ہدایات کی پیروی15 ٹول کالنگ6 مشترکہ1 ڈومین مخصوص1

16/16

درجہ	ماڈل	کمپنی	ہدایات پر عمل نہیں کیا کی تعداد	زمرہ اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#11	Gemini 3.5 Flash medium	Google	1	7.9	$0.582	2/3	12.6s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.582 ردِعمل کا وقت (اوسط) 12.6s
#48	Claude Opus 4.6 medium	Anthropic	1	5.7	$2.053	1/3	30.1s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $2.053 ردِعمل کا وقت (اوسط) 30.1s
#69	Claude Opus 4.8 none	Anthropic	1	5.5	$0.539	1/3	3.29s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.539 ردِعمل کا وقت (اوسط) 3.29s
#70	DeepSeek V4 Pro none	DeepSeek	1	5.6	$0.034	1/3	13.4s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.034 ردِعمل کا وقت (اوسط) 13.4s
#73	GLM 5.2 none	Z.ai	1	3.7	$0.030	0/3	7.55s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.030 ردِعمل کا وقت (اوسط) 7.55s
#84	Gemini 3.5 Flash minimal	Google	1	5.6	$0.108	1/3	2.75s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.108 ردِعمل کا وقت (اوسط) 2.75s
#127	Kimi K2.6 none	Moonshot AI	1	5.5	$0.078	1/3	82.6s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.078 ردِعمل کا وقت (اوسط) 82.6s
#132	Grok 4.1 Fast medium	X AI	1	7.8	$0.069	0/1	23.6s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.069 ردِعمل کا وقت (اوسط) 23.6s
#136	MiMo-V2.5-Pro none	Xiaomi	1	4.3	$0.017	0/3	1.41s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.017 ردِعمل کا وقت (اوسط) 1.41s
#139	Qwen3.5 Plus 2026-04-20 none	Qwen	1	3.9	$0.032	0/3	1.69s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.032 ردِعمل کا وقت (اوسط) 1.69s
#145	DeepSeek V3.2 none	DeepSeek	1	3.1	$0.017	0/3	14.5s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.017 ردِعمل کا وقت (اوسط) 14.5s
#157	Laguna M.1 medium	Poolside	1	1.5	$0.033	0/1	35.6s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.033 ردِعمل کا وقت (اوسط) 35.6s
#159	Cobuddy medium	Baidu	1	3.7	$0.000	0/3	79.2s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.000 ردِعمل کا وقت (اوسط) 79.2s
#178	MiMo-V2-Flash none	Xiaomi	1	4.3	$0.025	0/3	2.64s
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.025 ردِعمل کا وقت (اوسط) 2.64s
#182	Granite 4.1 8B none	IBM Granite	1	4.5	$0.003	0/3	775ms
کل ٹیسٹس 3 غلط ٹیسٹس 3 کل لاگت $0.003 ردِعمل کا وقت (اوسط) 775ms

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز

کوڈنگ: ہدایات پر عمل نہیں کیا

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز