اینٹی اے آئی چالیں x ہدایات پر عمل نہیں کیا درجہ بندی

دیکھیں کہ اینٹی اے آئی چالیں میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.

دکھائے گئے ماڈلز

کل ناکامیاں

سب سے زیادہ متاثر ماڈل

Step 3.7 Flash 1

ناکامی کی وجوہات

غلط جواب293 ہدایات پر عمل نہیں کیا33 اضافی فارمیٹنگ20 API خرابی14 ٹائم آؤٹ4 کوئی جواب نہیں4

زمرے

پہیلی حل کرنا90 عمومی ذہانت78 اینٹی اے آئی چالیں33 ہدایات کی پیروی18 کوڈنگ16 ٹول کالنگ8 مشترکہ1 ڈومین مخصوص1

32/32

درجہ	ماڈل	کمپنی	ہدایات پر عمل نہیں کیا کی تعداد	زمرہ اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#29	Step 3.7 Flash medium	Stepfun	1	8.7	$0.515	3/4	9.65s
کل ٹیسٹس 4 غلط ٹیسٹس 1 کل لاگت $0.515 ردِعمل کا وقت (اوسط) 9.65s
#64	Gemini 3.1 Flash Lite Preview medium	Google	1	9.1	$0.115	3/4	2.33s
کل ٹیسٹس 4 غلط ٹیسٹس 1 کل لاگت $0.115 ردِعمل کا وقت (اوسط) 2.33s
#65	Gemini 3.1 Flash Lite medium	Google	1	9.1	$0.117	3/4	2.39s
کل ٹیسٹس 4 غلط ٹیسٹس 1 کل لاگت $0.117 ردِعمل کا وقت (اوسط) 2.39s
#97	LongCat 2.0 high	Meituan	1	8.9	$0.469	3/4	7.76s
کل ٹیسٹس 4 غلط ٹیسٹس 1 کل لاگت $0.469 ردِعمل کا وقت (اوسط) 7.76s
#179	Ring-2.6-1T none	Inclusionai	1	9.2	$0.026	3/4	43.3s
کل ٹیسٹس 4 غلط ٹیسٹس 1 کل لاگت $0.026 ردِعمل کا وقت (اوسط) 43.3s
#21	GPT-5.2 medium	OpenAI	1	6.5	$0.951	2/4	7.81s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.951 ردِعمل کا وقت (اوسط) 7.81s
#26	GPT-5 Mini medium	OpenAI	1	7.1	$0.237	2/4	13.9s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.237 ردِعمل کا وقت (اوسط) 13.9s
#27	Muse Spark 1.1 high	Meta	1	7.5	$1.694	2/4	8.60s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $1.694 ردِعمل کا وقت (اوسط) 8.60s
#54	GPT-5.3 Chat none	OpenAI	1	6.7	$0.571	2/4	3.86s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.571 ردِعمل کا وقت (اوسط) 3.86s
#68	Kimi K2.6 medium	Moonshot AI	1	7.0	$1.036	2/4	11.6s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $1.036 ردِعمل کا وقت (اوسط) 11.6s
#78	Mercury 2 medium	Inception	1	6.9	$0.093	2/4	1.12s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.093 ردِعمل کا وقت (اوسط) 1.12s
#93	GLM 5V Turbo medium	Z.ai	1	7.2	$0.457	2/4	10.8s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.457 ردِعمل کا وقت (اوسط) 10.8s
#106	Gemini 3.1 Flash Lite Preview none	Google	1	7.5	$0.052	2/4	1.04s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.052 ردِعمل کا وقت (اوسط) 1.04s
#121	gpt-oss-120b medium	OpenAI	1	6.7	$0.019	2/4	10.2s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.019 ردِعمل کا وقت (اوسط) 10.2s
#172	MiniMax M2.7 medium	Minimax	1	7.9	$0.163	2/4	40.3s
کل ٹیسٹس 4 غلط ٹیسٹس 2 کل لاگت $0.163 ردِعمل کا وقت (اوسط) 40.3s

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز

اینٹی اے آئی چالیں: ہدایات پر عمل نہیں کیا

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز