اینٹی اے آئی چالیں x ہدایات پر عمل نہیں کیا درجہ بندی

دیکھیں کہ اینٹی اے آئی چالیں میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↑.

دکھائے گئے ماڈلز

کل ناکامیاں

سب سے زیادہ متاثر ماڈل

DeepSeek V4 Pro 1

ناکامی کی وجوہات

غلط جواب293 ہدایات پر عمل نہیں کیا33 اضافی فارمیٹنگ20 API خرابی14 ٹائم آؤٹ4 کوئی جواب نہیں4

زمرے

پہیلی حل کرنا90 عمومی ذہانت78 اینٹی اے آئی چالیں33 ہدایات کی پیروی18 کوڈنگ16 ٹول کالنگ8 مشترکہ1 ڈومین مخصوص1

32/32

درجہ	ماڈل	کمپنی	ہدایات پر عمل نہیں کیا کی تعداد	زمرہ اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#82	DeepSeek V4 Pro none	DeepSeek	1	3.2	$0.096	0/4	4.02s
کل ٹیسٹس 4 غلط ٹیسٹس 4 کل لاگت $0.096 ردِعمل کا وقت (اوسط) 4.02s
#148	Owl Alpha none	Openrouter	1	3.4	$0.000	0/4	2.78s
کل ٹیسٹس 4 غلط ٹیسٹس 4 کل لاگت $0.000 ردِعمل کا وقت (اوسط) 2.78s
#154	MiMo-V2.5-Pro none	Xiaomi	1	3.3	$0.068	0/4	2.67s
کل ٹیسٹس 4 غلط ٹیسٹس 4 کل لاگت $0.068 ردِعمل کا وقت (اوسط) 2.67s
#157	Mimo V2 Omni none	Xiaomi	1	3.6	$0.021	0/4	1.63s
کل ٹیسٹس 4 غلط ٹیسٹس 4 کل لاگت $0.021 ردِعمل کا وقت (اوسط) 1.63s
#166	Qwen3 Coder Next none	Qwen	1	3.6	$0.025	0/4	3.31s
کل ٹیسٹس 4 غلط ٹیسٹس 4 کل لاگت $0.025 ردِعمل کا وقت (اوسط) 3.31s
#187	Qwen3 Coder Next medium	Qwen	1	3.5	$0.032	0/4	8.64s
کل ٹیسٹس 4 غلط ٹیسٹس 4 کل لاگت $0.032 ردِعمل کا وقت (اوسط) 8.64s
#203	Grok 4.1 Fast none	X AI	1	3.2	$0.008	0/4	1.07s
کل ٹیسٹس 4 غلط ٹیسٹس 4 کل لاگت $0.008 ردِعمل کا وقت (اوسط) 1.07s
#205	Laguna Xs.2 none	Poolside	1	3.0	$0.004	0/4	534ms
کل ٹیسٹس 4 غلط ٹیسٹس 4 کل لاگت $0.004 ردِعمل کا وقت (اوسط) 534ms
#47	MiniMax M3 medium	Minimax	1	5.5	$0.286	1/4	14.9s
کل ٹیسٹس 4 غلط ٹیسٹس 3 کل لاگت $0.286 ردِعمل کا وقت (اوسط) 14.9s
#160	Laguna XS 2.1 none	Poolside	1	5.3	$0.008	1/4	755ms
کل ٹیسٹس 4 غلط ٹیسٹس 3 کل لاگت $0.008 ردِعمل کا وقت (اوسط) 755ms
#194	GLM 4.7 Flash medium	Z.ai	1	4.7	$0.166	1/4	15.0s
کل ٹیسٹس 4 غلط ٹیسٹس 3 کل لاگت $0.166 ردِعمل کا وقت (اوسط) 15.0s
#199	Hy3 preview none	Tencent	2	4.8	$0.003	1/4	11.1s
کل ٹیسٹس 4 غلط ٹیسٹس 3 کل لاگت $0.003 ردِعمل کا وقت (اوسط) 11.1s
#201	Granite 4.1 8B none	IBM Granite	1	4.9	$0.007	1/4	844ms
کل ٹیسٹس 4 غلط ٹیسٹس 3 کل لاگت $0.007 ردِعمل کا وقت (اوسط) 844ms
#21	GPT-5.2 medium	OpenAI	1	6.5	$0.951	2/4	7.81s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.951 ردِعمل کا وقت (اوسط) 7.81s
#26	GPT-5 Mini medium	OpenAI	1	7.1	$0.237	2/4	13.9s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.237 ردِعمل کا وقت (اوسط) 13.9s

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز

اینٹی اے آئی چالیں: ہدایات پر عمل نہیں کیا

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز