AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY زمرہ ناکامیاں

اینٹی اے آئی چالیں: غلط جواب

اینٹی اے آئی چالیں
غلط جواب

دیکھیں کہ اینٹی اے آئی چالیں میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

15

کل ناکامیاں

245

سب سے زیادہ متاثر ماڈل

Gemini 2.5 Flash 4
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#158 GLM 4.7 Flash medium Z.ai 2 4.7 1/4 15.0s
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 2 4.8 1/4 584ms
#163 Granite 4.1 8B none IBM Granite 2 4.9 1/4 844ms
#8 Claude Opus 4.7 none Anthropic 1 8.3 3/4 2.12s
#11 Claude Opus 4.7 medium Anthropic 1 8.3 3/4 1.85s
#13 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#15 GPT-5.3-Codex medium OpenAI 1 8.7 3/4 4.16s
#19 Seed-2.0-Lite medium Bytedance Seed 1 8.3 3/4 18.0s
#21 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#24 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#25 Qwen3.5 Plus 2026-02-15 medium Qwen 1 8.2 3/4 45.8s
#28 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#31 DeepSeek V4 Flash high DeepSeek 1 8.3 3/4 28.5s
#42 GPT-5.2 medium OpenAI 1 6.5 2/4 7.81s
#45 GPT-5.4 Mini medium OpenAI 1 8.6 3/4 4.05s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز