AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY زمرہ ناکامیاں

ہدایات کی پیروی: غلط جواب

ہدایات کی پیروی
غلط جواب

دیکھیں کہ ہدایات کی پیروی میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

15

کل ناکامیاں

53

سب سے زیادہ متاثر ماڈل

Gemini 3.5 Flash 1
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#32 Gemini 3.5 Flash minimal Google 1 6.4 1/2 893ms
#48 Gemini 3 Flash Preview none Google 1 6.4 1/2 1.58s
#55 GLM 5.1 medium Z.ai 1 6.4 1/2 7.47s
#77 Claude Sonnet 4.6 none Anthropic 1 6.5 1/2 1.96s
#85 Gemma 4 31B none Google 1 6.5 1/2 2.84s
#88 Qwen3.7 Plus none Qwen 1 6.3 1/2 929ms
#91 GPT-5.5 none OpenAI 1 6.2 1/2 1.15s
#101 Mimo V2 Omni none Xiaomi 1 6.5 1/2 4.26s
#102 Gemma 4 26B A4B none Google 1 6.3 1/2 690ms
#106 Grok 4.20 Beta none X AI 1 6.3 1/2 649ms
#108 Qwen3.5-Flash none Qwen 1 6.3 1/2 8.81s
#109 GLM 5V Turbo none Z.ai 1 6.5 1/2 1.97s
#111 Owl Alpha medium Openrouter 1 6.5 1/2 10.2s
#113 DeepSeek V4 Pro none DeepSeek 1 6.3 1/2 8.23s
#114 Qwen3.5 Plus 2026-04-20 none Qwen 1 6.2 1/2 1.17s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز