AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

15

کل ناکامیاں

1204

سب سے زیادہ متاثر ماڈل

Mistral Small 4 15
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#65 Grok 4.20 medium X AI 6 7.1 12/21 27.7s
#100 Grok Build 0.1 none X AI 7 6.0 7/19 28.7s
#26 Qwen3.6 Plus medium Qwen 5 7.9 14/21 30.7s
#105 Nemotron 3 Super medium NVIDIA 5 5.8 8/21 32.0s
#17 GLM 5 medium Z.ai 3 8.3 15/21 33.5s
#55 GLM 5.1 medium Z.ai 4 7.3 12/21 33.7s
#158 GLM 4.7 Flash medium Z.ai 9 4.4 4/21 35.1s
#9 GPT-5.5 medium OpenAI 4 8.8 17/21 38.0s
#130 MiniMax M2.7 medium Minimax 6 5.3 5/21 38.2s
#18 Qwen3.7 Plus medium Qwen 5 8.2 15/21 38.9s
#83 Step 3.5 Flash none Stepfun 1 6.6 6/12 39.0s
#119 Cobuddy medium Baidu 9 5.6 7/21 39.9s
#80 Mimo V2 Omni medium Xiaomi 5 6.7 10/21 41.2s
#29 Qwen3.5-122B-A10B medium Qwen 5 7.8 14/21 42.5s
#94 GPT-5 Nano medium OpenAI 9 6.3 9/21 42.5s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز