پہیلی حل کرنا x ہدایات پر عمل نہیں کیا درجہ بندی

دیکھیں کہ پہیلی حل کرنا میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.

دکھائے گئے ماڈلز

کل ناکامیاں

سب سے زیادہ متاثر ماڈل

GPT-5.3-Codex 1

ناکامی کی وجوہات

غلط جواب201 ہدایات پر عمل نہیں کیا90 API خرابی12 اضافی فارمیٹنگ8 ٹائم آؤٹ5 کوئی جواب نہیں3

زمرے

پہیلی حل کرنا90 عمومی ذہانت78 اینٹی اے آئی چالیں33 ہدایات کی پیروی18 کوڈنگ16 ٹول کالنگ8 مشترکہ1 ڈومین مخصوص1

86/86

درجہ	ماڈل	کمپنی	ہدایات پر عمل نہیں کیا کی تعداد	زمرہ اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#13	GPT-5.3-Codex medium	OpenAI	1	9.0	$0.920	2/3	5.05s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.920 ردِعمل کا وقت (اوسط) 5.05s
#16	Muse Spark 1.1 medium	Meta	1	7.9	$1.357	2/3	42.5s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $1.357 ردِعمل کا وقت (اوسط) 42.5s
#18	GPT-5.4 medium	OpenAI	1	8.2	$1.533	2/3	9.14s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $1.533 ردِعمل کا وقت (اوسط) 9.14s
#21	GPT-5.2 medium	OpenAI	1	7.5	$0.951	2/3	5.80s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.951 ردِعمل کا وقت (اوسط) 5.80s
#24	Muse Spark 1.1 low	Meta	1	8.3	$0.647	2/3	6.60s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.647 ردِعمل کا وقت (اوسط) 6.60s
#35	Seed-2.0-Lite medium	Bytedance Seed	1	9.0	$0.234	2/3	10.2s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.234 ردِعمل کا وقت (اوسط) 10.2s
#45	DeepSeek V4 Flash high	DeepSeek	1	8.2	$0.042	2/3	26.1s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.042 ردِعمل کا وقت (اوسط) 26.1s
#49	GLM 5 Turbo medium	Z.ai	1	8.7	$0.323	2/3	5.23s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.323 ردِعمل کا وقت (اوسط) 5.23s
#56	GPT-5.4 Mini medium	OpenAI	1	7.8	$0.756	2/3	4.37s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.756 ردِعمل کا وقت (اوسط) 4.37s
#58	Qwen3.5-27B medium	Qwen	1	8.2	$1.627	2/3	59.6s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $1.627 ردِعمل کا وقت (اوسط) 59.6s
#85	Qwen3.6 Flash medium	Qwen	1	8.2	$0.738	2/3	6.29s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.738 ردِعمل کا وقت (اوسط) 6.29s
#100	Hy3 preview medium	Tencent	1	7.7	$0.018	2/3	11.1s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.018 ردِعمل کا وقت (اوسط) 11.1s
#163	Gemini 3.1 Flash Lite Preview high	Google	1	7.7	$2.310	2/3	46.7s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $2.310 ردِعمل کا وقت (اوسط) 46.7s
#179	Ring-2.6-1T none	Inclusionai	1	7.7	$0.026	2/3	31.5s
کل ٹیسٹس 3 غلط ٹیسٹس 1 کل لاگت $0.026 ردِعمل کا وقت (اوسط) 31.5s
#26	GPT-5 Mini medium	OpenAI	1	5.6	$0.237	1/3	15.2s
کل ٹیسٹس 3 غلط ٹیسٹس 2 کل لاگت $0.237 ردِعمل کا وقت (اوسط) 15.2s

1 2 3 4 5 6

→

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز

پہیلی حل کرنا: ہدایات پر عمل نہیں کیا

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز