AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

1204

سب سے زیادہ متاثر ماڈل

Kimi K2.5 5
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#43 MiMo-V2.5-Pro medium Xiaomi 3 7.5 12/21 26.1s
#69 Claude Opus 4.6 medium Anthropic 3 7.0 12/21 25.9s
#89 Hy3 preview low Tencent 4 6.4 10/21 24.6s
#86 Grok 4.1 Fast medium X AI 4 6.5 9/19 23.8s
#54 GPT-5 Mini medium OpenAI 5 7.3 12/21 23.6s
#59 GLM 5V Turbo medium Z.ai 7 7.2 11/21 23.1s
#23 GLM 5 Turbo medium Z.ai 4 8.0 14/21 23.0s
#21 GPT-5.4 medium OpenAI 5 8.0 14/21 22.3s
#45 GPT-5.4 Mini medium OpenAI 6 7.5 12/21 22.3s
#99 gpt-oss-120b medium OpenAI 9 6.1 9/21 22.3s
#51 Mimo V2 PRO medium Xiaomi 5 7.4 12/21 22.2s
#126 gpt-oss-120b none OpenAI 8 5.4 6/19 21.6s
#22 Step 3.7 Flash medium Stepfun 5 8.0 14/21 20.4s
#4 Gemini 3.1 Pro Preview medium Google 2 9.4 19/21 20.1s
#64 MiMo-V2-Flash medium Xiaomi 5 7.2 12/21 20.1s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز