عمومی ذہانت x ہدایات پر عمل نہیں کیا درجہ بندی

دیکھیں کہ عمومی ذہانت میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.

دکھائے گئے ماڈلز

کل ناکامیاں

سب سے زیادہ متاثر ماڈل

Qwen3.5-27B 1

ناکامی کی وجوہات

ہدایات پر عمل نہیں کیا78 غلط جواب59 API خرابی12 ٹائم آؤٹ4

زمرے

پہیلی حل کرنا90 عمومی ذہانت78 اینٹی اے آئی چالیں33 ہدایات کی پیروی18 کوڈنگ16 ٹول کالنگ8 مشترکہ1 ڈومین مخصوص1

78/78

درجہ	ماڈل	کمپنی	ہدایات پر عمل نہیں کیا کی تعداد	زمرہ اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#58	Qwen3.5-27B medium	Qwen	1	6.1	$1.627	0/1	101.4s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $1.627 ردِعمل کا وقت (اوسط) 101.4s
#77	Kimi K2.5 medium	Moonshot AI	1	6.5	$0.600	0/1	69.7s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.600 ردِعمل کا وقت (اوسط) 69.7s
#146	Owl Alpha medium	Openrouter	1	4.3	$0.000	0/1	58.6s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.000 ردِعمل کا وقت (اوسط) 58.6s
#108	Ring-2.6-1T medium	Inclusionai	1	4.1	$0.103	0/1	58.3s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.103 ردِعمل کا وقت (اوسط) 58.3s
#143	Gemini 3.1 Flash Lite high	Google	1	5.0	$2.044	0/1	45.7s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $2.044 ردِعمل کا وقت (اوسط) 45.7s
#114	Qwen3.5-Flash medium	Qwen	1	6.1	$0.139	0/1	40.1s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.139 ردِعمل کا وقت (اوسط) 40.1s
#99	Qwen3.6 27B medium	Qwen	1	6.5	$0.779	0/1	39.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.779 ردِعمل کا وقت (اوسط) 39.5s
#172	MiniMax M2.7 medium	Minimax	1	3.9	$0.163	0/1	38.7s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.163 ردِعمل کا وقت (اوسط) 38.7s
#80	Seed-2.0-Mini medium	Bytedance Seed	1	5.1	$0.101	0/1	36.7s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.101 ردِعمل کا وقت (اوسط) 36.7s
#47	MiniMax M3 medium	Minimax	1	5.1	$0.286	0/1	33.3s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.286 ردِعمل کا وقت (اوسط) 33.3s
#37	Qwen3.6 Plus medium	Qwen	1	5.1	$0.405	0/1	27.1s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.405 ردِعمل کا وقت (اوسط) 27.1s
#45	DeepSeek V4 Flash high	DeepSeek	1	6.1	$0.042	0/1	25.2s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.042 ردِعمل کا وقت (اوسط) 25.2s
#73	Grok 4.3 medium	X AI	1	5.4	$0.779	0/1	24.7s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.779 ردِعمل کا وقت (اوسط) 24.7s
#75	Grok 4.20 medium	X AI	1	3.9	$0.777	0/1	24.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.777 ردِعمل کا وقت (اوسط) 24.5s
#188	Cobuddy medium	Baidu	1	4.2	$0.000	0/1	23.2s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.000 ردِعمل کا وقت (اوسط) 23.2s

1 2 3 4 5 6

→

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز

عمومی ذہانت: ہدایات پر عمل نہیں کیا

ماڈلز فلٹر کریں

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز