AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY زمرہ ناکامیاں

مشترکہ: غلط جواب

مشترکہ
غلط جواب

دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

15

کل ناکامیاں

37

سب سے زیادہ متاثر ماڈل

Mercury 2 1
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#91 Mercury 2 none Inception 1 3.0 0/1 606ms
#83 Mistral Small 4 none Mistral 1 3.0 0/1 1.72s
#55 MiMo-V2-Omni none Xiaomi 1 3.0 0/1 2.47s
#86 GPT-5.4 Mini none OpenAI 1 3.0 0/1 2.52s
#94 MiMo-V2-Flash none Xiaomi 1 3.0 0/1 2.87s
#66 GPT-5.4 none OpenAI 1 3.0 0/1 2.89s
#29 Gemini 3.1 Flash Lite Preview none Google 1 3.0 0/1 3.20s
#5 Gemini 3 Flash Preview low Google 1 3.0 0/1 3.27s
#95 Grok 4.1 Fast none X AI 1 3.0 0/1 3.33s
#69 Kimi K2.6 none Moonshot AI 1 3.0 0/1 3.38s
#21 Gemini 3 Flash Preview none Google 1 4.7 0/1 3.56s
#81 Elephant medium Openrouter 1 3.0 0/1 3.70s
#85 Elephant none Openrouter 1 3.0 0/1 3.81s
#96 GPT-5.4 Nano none OpenAI 1 3.0 0/1 3.84s
#92 Qwen3 Coder Next medium Qwen 1 3.0 0/1 4.28s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز