AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

572

سب سے زیادہ متاثر ماڈل

Gemini 3.1 Pro Preview 1
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#30 Step 3.5 Flash medium Stepfun 3 7.9 11/17 26.8s
#31 GLM 5V Turbo medium Z.ai 3 7.8 11/18 15.0s
#32 Qwen3.5-Flash medium Qwen 1 7.8 11/18 66.7s
#34 Kimi K2.6 medium Moonshot AI 2 7.7 11/18 45.2s
#35 MiMo-V2-Omni medium Xiaomi 3 7.7 11/18 16.8s
#36 GPT-5.3 Chat none OpenAI 5 7.7 11/18 5.88s
#38 GPT-5.4 Nano medium OpenAI 4 7.6 11/18 11.2s
#39 Seed-2.0-Mini medium Bytedance Seed 2 7.5 11/18 69.7s
#40 GPT-5.2 medium OpenAI 2 7.5 11/18 14.0s
#41 MiMo-V2-Flash medium Xiaomi 3 7.5 11/18 23.4s
#42 Claude Sonnet 4.6 none Anthropic 3 7.4 11/18 4.98s
#43 Qwen3.5-35B-A3B medium Qwen 2 7.4 10/18 44.5s
#48 Gemma 4 31B none Google 5 6.9 10/18 4.02s
#44 GPT-5.4 Mini medium OpenAI 4 7.3 9/18 15.2s
#45 GPT-5 Mini medium OpenAI 4 7.0 9/18 24.0s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز