AI BENCHY
Advertise here

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

1204

سب سے زیادہ متاثر ماڈل

Kimi K2.5 5
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#39 Qwen3.6 Flash medium Qwen 8 7.5 12/21 19.2s
#1 Gemini 3 Flash Preview medium Google 1 9.8 20/21 18.6s
#46 Qwen3.6 35B A3B medium Qwen 4 7.4 13/21 18.1s
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 7 4.6 4/19 17.1s
#52 Claude Sonnet 4.6 medium Anthropic 4 7.4 13/21 17.1s
#42 GPT-5.2 medium OpenAI 3 7.5 13/21 16.9s
#33 Hy3 preview medium Tencent 3 7.7 14/21 16.3s
#15 GPT-5.3-Codex medium OpenAI 4 8.4 15/21 16.2s
#5 Qwen3.7 Max medium Qwen 3 9.1 18/21 16.0s
#57 Step 3.7 Flash low Stepfun 8 7.3 12/21 15.7s
#28 Gemini 2.5 Flash medium Google 6 7.8 14/21 15.5s
#93 Qwen3.6 Plus Preview medium Qwen 2 6.3 9/19 15.2s
#41 Nemotron 3 Ultra 550b A55b medium NVIDIA 7 7.5 13/21 15.1s
#92 Laguna M.1 medium Poolside 4 6.4 9/19 14.7s
#133 DeepSeek V3.2 none DeepSeek 7 5.2 6/21 13.8s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز