AI BENCHY
Your ad here

AI BENCHY زمرہ ناکامیاں

ہدایات کی پیروی: غلط جواب

ہدایات کی پیروی
غلط جواب

دیکھیں کہ ہدایات کی پیروی میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

44

سب سے زیادہ متاثر ماڈل

Gemini 3 Flash Preview 1
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#21 Gemini 3 Flash Preview none Google 1 6.4 1/2 1.58s
#28 GPT-5.2 Chat none OpenAI 1 7.5 1/2 5.46s
#33 GLM 5.1 medium Z.ai 1 6.4 1/2 7.47s
#36 GPT-5.3 Chat none OpenAI 1 8.3 1/2 3.29s
#42 Claude Sonnet 4.6 none Anthropic 1 6.5 1/2 1.96s
#48 Gemma 4 31B none Google 1 6.5 1/2 2.84s
#55 MiMo-V2-Omni none Xiaomi 1 6.5 1/2 4.18s
#58 GLM 5V Turbo none Z.ai 1 6.5 1/2 1.97s
#59 Qwen3.5-Flash none Qwen 1 6.3 1/2 8.81s
#62 Gemini 2.5 Flash none Google 1 8.0 1/2 672ms
#63 Qwen3.5-35B-A3B none Qwen 1 6.3 1/2 809ms
#65 MiMo-V2-Pro none Xiaomi 1 6.5 1/2 2.51s
#66 GPT-5.4 none OpenAI 1 6.5 1/2 1.07s
#69 Kimi K2.6 none Moonshot AI 1 6.5 1/2 1.64s
#72 Hunter Alpha none OpenRouter 1 6.4 1/2 2.82s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز