AI BENCHY
Your ad here

إخفاقات AI BENCHY

إخفاقات إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي تواجه إجابة خاطئة أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: النتيجة ↑.

النماذج المعروضة

7

إجمالي الإخفاقات

572

النموذج الأكثر تأثرًا

LFM2-24B-A2B 9
الترتيب النموذج الشركة عدد إجابة خاطئة النتيجة اختبارات صحيحة زمن الاستجابة (المتوسط)
#8 Qwen3.5 Plus 2026-02-15 medium Qwen 2 8.5 14/18 46.6s
#7 GPT-5.3-Codex medium OpenAI 3 8.6 13/18 15.4s
#6 Seed-2.0-Lite medium Bytedance Seed 3 8.6 13/18 30.4s
#5 Gemini 3 Flash Preview low Google 3 8.8 15/18 6.01s
#4 Claude Opus 4.7 none Anthropic 2 9.2 16/18 3.13s
#3 Claude Opus 4.7 medium Anthropic 1 9.2 16/18 3.53s
#2 Gemini 3.1 Pro Preview medium Google 1 9.6 17/18 16.0s

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)