AI BENCHY
Advertise here

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

1204

سب سے زیادہ متاثر ماڈل

Kimi K2.5 5
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#80 Mimo V2 Omni medium Xiaomi 5 6.7 10/21 41.2s
#119 Cobuddy medium Baidu 9 5.6 7/21 39.9s
#83 Step 3.5 Flash none Stepfun 1 6.6 6/12 39.0s
#18 Qwen3.7 Plus medium Qwen 5 8.2 15/21 38.9s
#130 MiniMax M2.7 medium Minimax 6 5.3 5/21 38.2s
#9 GPT-5.5 medium OpenAI 4 8.8 17/21 38.0s
#158 GLM 4.7 Flash medium Z.ai 9 4.4 4/21 35.1s
#55 GLM 5.1 medium Z.ai 4 7.3 12/21 33.7s
#17 GLM 5 medium Z.ai 3 8.3 15/21 33.5s
#105 Nemotron 3 Super medium NVIDIA 5 5.8 8/21 32.0s
#26 Qwen3.6 Plus medium Qwen 5 7.9 14/21 30.7s
#100 Grok Build 0.1 none X AI 7 6.0 7/19 28.7s
#65 Grok 4.20 medium X AI 6 7.1 12/21 27.7s
#56 MiMo-V2.5 medium Xiaomi 5 7.3 12/21 27.1s
#139 DeepSeek V4 Flash none DeepSeek 12 5.0 5/21 26.8s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز