AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

إخفاقات AI BENCHY

إخفاقات إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: زمن الاستجابة (المتوسط) ↓.

النماذج المعروضة

15

إجمالي الإخفاقات

572

النموذج الأكثر تأثرًا

Qwen3.5-9B 1
الترتيب النموذج الشركة عدد إجابة خاطئة النتيجة اختبارات صحيحة زمن الاستجابة (المتوسط)
#75 GLM 5.1 none Z.ai 10 5.6 5/18 4.33s
#53 GLM 5 none Z.ai 9 6.6 9/18 4.23s
#48 Gemma 4 31B none Google 5 6.9 10/18 4.02s
#63 Qwen3.5-35B-A3B none Qwen 9 6.1 7/18 3.82s
#17 Gemini 3.1 Flash Lite Preview medium Google 4 8.2 13/18 3.74s
#70 Qwen3.5-122B-A10B none Qwen 11 5.7 6/18 3.69s
#3 Claude Opus 4.7 medium Anthropic 1 9.2 16/18 3.53s
#74 GLM 4.7 Flash none Z.ai 10 5.6 5/18 3.35s
#59 Qwen3.5-Flash none Qwen 9 6.2 8/18 3.25s
#22 Gemini 3.1 Flash Lite Preview low Google 4 8.1 13/18 3.22s
#4 Claude Opus 4.7 none Anthropic 2 9.2 16/18 3.13s
#58 GLM 5V Turbo none Z.ai 8 6.2 8/18 3.10s
#77 GLM 5 Turbo none Z.ai 10 5.5 6/18 2.94s
#94 MiMo-V2-Flash none Xiaomi 12 4.5 3/18 2.79s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 9 6.8 9/18 2.60s

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)