AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

15

کل ناکامیاں

572

سب سے زیادہ متاثر ماڈل

Mercury 2 13
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#12 Gemini 3 PRO Preview medium Google 3 8.4 14/18 9.06s
#56 Grok 4.20 Multi Agent Beta medium X AI 3 6.4 7/18 9.80s
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#87 Qwen3 Coder Next none Qwen 12 5.1 4/18 10.2s
#47 Grok 4.20 medium X AI 3 7.0 9/18 10.3s
#50 Hunter Alpha medium OpenRouter 4 6.7 8/18 10.3s
#92 Qwen3 Coder Next medium Qwen 9 4.7 3/18 10.8s
#38 GPT-5.4 Nano medium OpenAI 4 7.6 11/18 11.2s
#84 gpt-oss-120b none OpenAI 6 5.2 4/18 12.0s
#64 DeepSeek V3.2 none DeepSeek 8 6.1 7/18 12.1s
#15 Gemini 2.5 Flash medium Google 4 8.2 13/18 12.1s
#23 MiMo-V2-Pro medium Xiaomi 3 8.1 12/18 12.3s
#26 Claude Sonnet 4.6 medium Anthropic 2 8.0 13/18 12.7s
#76 Kimi K2.5 none Moonshot AI 12 5.5 6/18 13.4s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز