AI BENCHY زمرہ ناکامیاں

مشترکہ

غلط جواب

دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

کل ناکامیاں

سب سے زیادہ متاثر ماڈل

متعلقہ ناکامی کی وجوہات

غلط جواب21 غیر معتبر ٹول کال4 API خرابی1 کوئی جواب نہیں1

متعلقہ زمرے

ڈومین مخصوص98 پہیلی حل کرنا55 اینٹی اے آئی چالیں53 ہدایات کی پیروی26 مشترکہ21 ڈیٹا پارسنگ اور استخراج14 عمومی ذہانت6 ٹول کالنگ2

درجہ	ماڈل	کمپنی	غلط جواب کی تعداد	زمرہ اسکور	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#5	Gemini 3 Flash Preview low	Google	1	10.0	0/1	3.27s
#6	Gemini 3 Pro Preview medium	Google	1	10.0	0/1	10.4s
#17	Gemini 3.1 Flash Lite Preview low	Google	1	10.0	0/1	11.9s
#20	Gemini 3 Flash Preview none	Google	1	10.0	0/1	3.56s
#22	Gemini 3.1 Flash Lite Preview none	Google	1	10.0	0/1	3.20s
#29	Qwen3.5 Plus 2026-02-15 none	Qwen	1	10.0	0/1	6.65s
#31	GLM 5 none	Z.ai	1	10.0	0/1	4.98s
#37	Qwen3.5-Flash none	Qwen	1	10.0	0/1	6.22s
#38	Gemini 2.5 Flash none	Google	1	10.0	0/1	4.39s
#40	Qwen3.5-122B-A10B none	Qwen	1	10.0	0/1	46.0s
#41	Qwen3.5-27B none	Qwen	1	10.0	0/1	9.39s
#42	Qwen3.5-35B-A3B none	Qwen	1	10.0	0/1	47.4s
#44	GPT-5.4 none	OpenAI	1	10.0	0/1	2.89s
#45	Trinity Large Preview none	Arcee AI	1	10.0	0/1	8.91s
#46	Kimi K2.5 none	Moonshot AI	1	10.0	0/1	19.2s
#47	GPT-4o-mini none	OpenAI	1	10.0	0/1	7.58s
#48	Qwen3 Coder Next none	Qwen	1	10.0	0/1	45.1s
#50	Qwen3 Coder Next medium	Qwen	1	10.0	0/1	4.28s
#51	Mercury 2 none	Inception	1	10.0	0/1	606ms
#53	Grok 4.1 Fast none	X AI	1	10.0	0/1	3.33s
#54	MiMo-V2-Flash none	Xiaomi	1	10.0	0/1	2.87s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز