AI BENCHY
Your ad here

AI BENCHY زمرہ ناکامیاں

مشترکہ: غلط جواب

مشترکہ
غلط جواب

دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

7

کل ناکامیاں

37

سب سے زیادہ متاثر ماڈل

Gemini 3 Flash Preview 1
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#88 Nemotron 3 Super none NVIDIA 1 3.0 0/1 20.0s
#89 GPT-4o-mini none OpenAI 1 3.0 0/1 7.58s
#91 Mercury 2 none Inception 1 3.0 0/1 606ms
#92 Qwen3 Coder Next medium Qwen 1 3.0 0/1 4.28s
#94 MiMo-V2-Flash none Xiaomi 1 3.0 0/1 2.87s
#95 Grok 4.1 Fast none X AI 1 3.0 0/1 3.33s
#96 GPT-5.4 Nano none OpenAI 1 3.0 0/1 3.84s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز