AI BENCHY
Your ad here

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: اسکور ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

572

سب سے زیادہ متاثر ماڈل

Gemini 3.1 Pro Preview 1
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#17 Gemini 3.1 Flash Lite Preview medium Google 4 8.2 13/18 3.74s
#18 GLM 5 Turbo medium Z.ai 3 8.1 12/18 17.7s
#19 Qwen3.5-122B-A10B medium Qwen 3 8.1 13/18 31.4s
#20 Qwen3.6 Plus medium Qwen 3 8.1 13/18 15.3s
#21 Gemini 3 Flash Preview none Google 5 8.1 13/18 1.65s
#22 Gemini 3.1 Flash Lite Preview low Google 4 8.1 13/18 3.22s
#23 MiMo-V2-Pro medium Xiaomi 3 8.1 12/18 12.3s
#24 Gemma 4 26B A4B medium Google 2 8.0 13/18 25.0s
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#26 Claude Sonnet 4.6 medium Anthropic 2 8.0 13/18 12.7s
#27 DeepSeek V3.2 medium DeepSeek 3 8.0 12/18 46.4s
#28 GPT-5.2 Chat none OpenAI 5 7.9 12/18 6.84s
#29 Gemini 3.1 Flash Lite Preview none Google 4 7.9 12/18 1.30s
#30 Step 3.5 Flash medium Stepfun 3 7.9 11/17 26.8s
#31 GLM 5V Turbo medium Z.ai 3 7.8 11/18 15.0s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز