معلومات عامہ x غلط جواب درجہ بندی

AI BENCHY زمرہ ناکامیاں

دیکھیں کہ معلومات عامہ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

کل ناکامیاں

133

سب سے زیادہ متاثر ماڈل

Qwen3.7 Max 1

ناکامی کی وجوہات

غلط جواب133 API خرابی13 کوئی جواب نہیں8

زمرے

ڈومین مخصوص325 اینٹی اے آئی چالیں250 کوڈنگ201 پہیلی حل کرنا154 معلومات عامہ133 ہدایات کی پیروی54 مشترکہ53 عمومی ذہانت36 ڈیٹا پارسنگ اور استخراج35 ٹول کالنگ2

133/133

درجہ	ماڈل	کمپنی	غلط جواب کی تعداد	زمرہ اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#42	Grok Build 0.1 medium	X AI	1	3.0	$0.927	0/1	53.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.927 ردِعمل کا وقت (اوسط) 53.5s
#43	Kimi K2.5 medium	Moonshot AI	1	3.0	$0.348	0/1	83.9s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.348 ردِعمل کا وقت (اوسط) 83.9s
#44	Mercury 2 medium	Inception	1	3.0	$0.058	0/1	2.58s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.058 ردِعمل کا وقت (اوسط) 2.58s
#45	GPT-5.3 Chat none	OpenAI	1	3.0	$0.433	0/1	4.38s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.433 ردِعمل کا وقت (اوسط) 4.38s
#46	GPT-5.4 Nano medium	OpenAI	1	3.0	$0.107	0/1	4.81s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.107 ردِعمل کا وقت (اوسط) 4.81s
#47	Qwen3.6 Flash medium	Qwen	1	3.0	$0.288	0/1	122.9s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.288 ردِعمل کا وقت (اوسط) 122.9s
#48	DeepSeek V3.2 medium	DeepSeek	1	3.0	$0.044	0/1	84.0s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.044 ردِعمل کا وقت (اوسط) 84.0s
#49	Claude Opus 4.7 none	Anthropic	1	3.0	$0.505	0/1	1.46s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.505 ردِعمل کا وقت (اوسط) 1.46s
#50	Seed-2.0-Mini medium	Bytedance Seed	1	3.0	$0.044	0/1	56.8s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.044 ردِعمل کا وقت (اوسط) 56.8s
#51	MiMo-V2.5-Pro medium	Xiaomi	1	3.0	$0.106	0/1	12.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.106 ردِعمل کا وقت (اوسط) 12.5s
#53	Grok 4.20 medium	X AI	1	3.0	$0.609	0/1	63.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.609 ردِعمل کا وقت (اوسط) 63.5s
#54	Hy3 preview medium	Tencent	1	3.0	$0.021	0/1	39.9s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.021 ردِعمل کا وقت (اوسط) 39.9s
#55	Claude Sonnet 4.6 none	Anthropic	1	3.0	$0.316	0/1	4.67s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.316 ردِعمل کا وقت (اوسط) 4.67s
#56	GLM 5V Turbo medium	Z.ai	1	3.0	$0.457	0/1	41.0s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.457 ردِعمل کا وقت (اوسط) 41.0s
#58	DeepSeek V4 Pro none	DeepSeek	1	3.0	$0.034	0/1	5.76s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.034 ردِعمل کا وقت (اوسط) 5.76s

←

1 2 3 4 9

→

ماڈلز فلٹر کریں

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز

معلومات عامہ: غلط جواب

ماڈلز فلٹر کریں

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز