AI BENCHY
موازنہ کریں چارٹس طریقہ کار
❤️ Made by XCS
Your ad here

AI BENCHY زمرہ ناکامیاں

عمومی ذہانت
غلط جواب

دیکھیں کہ عمومی ذہانت میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.

دکھائے گئے ماڈلز

6

کل ناکامیاں

6

سب سے زیادہ متاثر ماڈل

GLM 4.7 Flash 1
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#52 GLM 4.7 Flash medium Z.ai 1 10.0 0/1 18.1s
#29 Qwen3.5 Plus 2026-02-15 none Qwen 1 4.0 0/1 2.26s
#44 GPT-5.4 none OpenAI 1 3.0 0/1 1.78s
#49 GLM 4.7 Flash none Z.ai 1 3.0 0/1 1.59s
#47 GPT-4o-mini none OpenAI 1 3.0 0/1 909ms
#38 Gemini 2.5 Flash none Google 1 5.0 0/1 615ms

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اوسط اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز