AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

إخفاقات الفئات في AI BENCHY

معلومات عامة: إجابة خاطئة

معلومات عامة
إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في معلومات عامة، حتى ترصد نقاط الضعف بسرعة أكبر.

النماذج المعروضة

15

إجمالي الإخفاقات

117

النموذج الأكثر تأثرًا

Claude Opus 4.7 1

أسباب الفشل

الترتيب النموذج الشركة عدد إجابة خاطئة درجة الفئة اختبارات صحيحة زمن الاستجابة (المتوسط)
#3 Claude Opus 4.7 medium Anthropic 1 3.0 0/1 2.25s
#4 GPT-5.5 medium OpenAI 1 2.8 0/1 37.9s
#5 Claude Opus 4.7 none Anthropic 1 3.0 0/1 1.46s
#6 GPT-5.5 low OpenAI 1 3.0 0/1 10.1s
#9 Qwen3.6 Max Preview medium Qwen 1 3.0 0/1 60.6s
#11 Seed-2.0-Lite medium Bytedance Seed 1 3.0 0/1 48.3s
#12 Qwen3.5 Plus 2026-02-15 medium Qwen 1 3.0 0/1 103.8s
#13 GPT-5.3-Codex medium OpenAI 1 2.8 0/1 14.4s
#14 Gemma 4 31B medium Google 1 3.0 0/1 90.1s
#17 Qwen3.5-27B medium Qwen 1 3.0 0/1 85.1s
#19 GLM 5 medium Z.ai 1 3.0 0/1 67.4s
#20 GLM 5 Turbo medium Z.ai 1 3.0 0/1 40.2s
#21 Qwen3.6 35B A3B medium Qwen 1 3.0 0/1 32.9s
#22 HY3 Preview high Tencent 1 3.0 0/1 47.7s
#23 Gemini 3.1 Flash Lite Preview medium Google 1 3.0 0/1 2.68s

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)

أفضل النماذج حسب التكلفة المهدرة التقديرية