AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY زمرہ ناکامیاں

اینٹی اے آئی چالیں: غلط جواب

اینٹی اے آئی چالیں
غلط جواب

دیکھیں کہ اینٹی اے آئی چالیں میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

165

سب سے زیادہ متاثر ماڈل

Claude Opus 4.7 1
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#3 Claude Opus 4.7 medium Anthropic 1 8.3 3/4 1.85s
#4 Claude Opus 4.7 none Anthropic 1 8.3 3/4 2.12s
#6 Seed-2.0-Lite medium Bytedance Seed 1 8.3 3/4 18.0s
#7 GPT-5.3-Codex medium OpenAI 1 8.7 3/4 4.16s
#8 Qwen3.5 Plus 2026-02-15 medium Qwen 1 8.2 3/4 45.8s
#15 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#16 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#21 Gemini 3 Flash Preview none Google 1 8.3 3/4 1.25s
#22 Gemini 3.1 Flash Lite Preview low Google 1 8.3 3/4 2.12s
#25 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#27 DeepSeek V3.2 medium DeepSeek 1 8.4 3/4 30.7s
#28 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#38 GPT-5.4 Nano medium OpenAI 1 8.3 3/4 4.52s
#44 GPT-5.4 Mini medium OpenAI 1 8.6 3/4 4.05s
#47 Grok 4.20 medium X AI 1 8.2 3/4 3.36s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز