AI BENCHY
Advertise here

AI BENCHY زمرہ ناکامیاں

معلومات عامہ: غلط جواب

معلومات عامہ
غلط جواب

دیکھیں کہ معلومات عامہ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

117

سب سے زیادہ متاثر ماڈل

MiMo-V2-Omni 1

ناکامی کی وجوہات

درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#62 MiMo-V2-Omni medium Xiaomi 1 3.0 0/1 234.2s
#38 Gemma 4 26B A4B medium Google 1 3.0 0/1 180.9s
#57 Qwen3.5-35B-A3B medium Qwen 1 3.0 0/1 177.4s
#140 Qwen3.5-9B medium Qwen 1 3.0 0/1 177.0s
#42 Kimi K2.6 medium Moonshot AI 1 3.0 0/1 130.3s
#50 Qwen3.6 Flash medium Qwen 1 3.0 0/1 122.9s
#36 Step 3.5 Flash none Stepfun 1 3.0 0/1 114.1s
#43 Step 3.5 Flash medium Stepfun 1 3.0 0/1 108.4s
#12 Qwen3.5 Plus 2026-02-15 medium Qwen 1 3.0 0/1 103.8s
#33 Qwen3.5 Plus 2026-04-20 medium Qwen 1 3.0 0/1 92.6s
#14 Gemma 4 31B medium Google 1 3.0 0/1 90.1s
#17 Qwen3.5-27B medium Qwen 1 3.0 0/1 85.1s
#59 DeepSeek V3.2 medium DeepSeek 1 3.0 0/1 84.0s
#69 Kimi K2.5 medium Moonshot AI 1 3.0 0/1 83.9s
#37 MiMo-V2-Pro medium Xiaomi 1 3.0 0/1 82.7s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز