AI BENCHY
Advertise here

AI BENCHY ناکامیاں

غلط جواب ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غلط جواب سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

1204

سب سے زیادہ متاثر ماڈل

Gemini 3 Flash Preview 1
درجہ ماڈل کمپنی غلط جواب کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#77 Claude Sonnet 4.6 none Anthropic 5 6.8 11/21 5.04s
#82 Hy3 preview high Tencent 3 6.6 11/21 56.6s
#83 Step 3.5 Flash none Stepfun 1 6.6 6/12 39.0s
#76 Kimi K2.5 medium Moonshot AI 5 6.8 10/21 98.4s
#78 Qwen3.6 27B medium Qwen 6 6.8 10/21 59.7s
#80 Mimo V2 Omni medium Xiaomi 5 6.7 10/21 41.2s
#81 Mercury 2 medium Inception 8 6.6 10/21 2.24s
#85 Gemma 4 31B none Google 8 6.5 10/21 4.05s
#87 Gemini 3.1 Flash Lite minimal Google 8 6.4 10/21 1.33s
#88 Qwen3.7 Plus none Qwen 10 6.4 10/21 2.85s
#89 Hy3 preview low Tencent 4 6.4 10/21 24.6s
#91 GPT-5.5 none OpenAI 11 6.4 10/21 1.89s
#86 Grok 4.1 Fast medium X AI 4 6.5 9/19 23.8s
#92 Laguna M.1 medium Poolside 4 6.4 9/19 14.7s
#93 Qwen3.6 Plus Preview medium Qwen 2 6.3 9/19 15.2s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز