AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ناکامیوں کی تعداد ↑.

دکھائے گئے ماڈلز

15

کل ناکامیاں

1204

سب سے زیادہ متاثر ماڈل

Gemini 3 Flash Preview 1
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#78 Qwen3.6 27B medium Qwen 6 6.8 10/21 59.7s
#107 Laguna Xs.2 medium Poolside 6 5.8 6/19 6.73s
#130 MiniMax M2.7 medium Minimax 6 5.3 5/21 38.2s
#34 Qwen3.7 Max none Qwen 7 7.7 14/21 1.30s
#40 Gemini 3.1 Flash Lite Preview medium Google 7 7.5 13/21 3.96s
#41 Nemotron 3 Ultra 550b A55b medium NVIDIA 7 7.5 13/21 15.1s
#44 Gemini 3.1 Flash Lite medium Google 7 7.5 13/21 3.23s
#50 Gemini 3.1 Flash Lite Preview low Google 7 7.4 13/21 2.77s
#58 Gemini 3.1 Flash Lite Preview none Google 7 7.2 12/21 1.21s
#59 GLM 5V Turbo medium Z.ai 7 7.2 11/21 23.1s
#63 GPT-5.3 Chat none OpenAI 7 7.2 12/21 6.34s
#100 Grok Build 0.1 none X AI 7 6.0 7/19 28.7s
#129 MiniMax M2.5 medium Minimax 7 5.3 5/21 65.4s
#133 DeepSeek V3.2 none DeepSeek 7 5.2 6/21 13.8s
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 7 4.6 4/19 17.1s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز