AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

إخفاقات AI BENCHY

إخفاقات إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↓.

النماذج المعروضة

15

إجمالي الإخفاقات

1204

النموذج الأكثر تأثرًا

Kimi K2.5 5
الترتيب النموذج الشركة عدد إجابة خاطئة النتيجة اختبارات صحيحة زمن الاستجابة (المتوسط)
#39 Qwen3.6 Flash medium Qwen 8 7.5 12/21 19.2s
#1 Gemini 3 Flash Preview medium Google 1 9.8 20/21 18.6s
#46 Qwen3.6 35B A3B medium Qwen 4 7.4 13/21 18.1s
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 7 4.6 4/19 17.1s
#52 Claude Sonnet 4.6 medium Anthropic 4 7.4 13/21 17.1s
#42 GPT-5.2 medium OpenAI 3 7.5 13/21 16.9s
#33 Hy3 preview medium Tencent 3 7.7 14/21 16.3s
#15 GPT-5.3-Codex medium OpenAI 4 8.4 15/21 16.2s
#5 Qwen3.7 Max medium Qwen 3 9.1 18/21 16.0s
#57 Step 3.7 Flash low Stepfun 8 7.3 12/21 15.7s
#28 Gemini 2.5 Flash medium Google 6 7.8 14/21 15.5s
#93 Qwen3.6 Plus Preview medium Qwen 2 6.3 9/19 15.2s
#41 Nemotron 3 Ultra 550b A55b medium NVIDIA 7 7.5 13/21 15.1s
#92 Laguna M.1 medium Poolside 4 6.4 9/19 14.7s
#133 DeepSeek V3.2 none DeepSeek 7 5.2 6/21 13.8s

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)