AI BENCHY
Your ad here

إخفاقات الفئات في AI BENCHY

خاص بالمجال: إجابة خاطئة

خاص بالمجال
إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في خاص بالمجال، حتى ترصد نقاط الضعف بسرعة أكبر.

النماذج المعروضة

15

إجمالي الإخفاقات

182

النموذج الأكثر تأثرًا

Qwen3.6 Plus Preview 3
الترتيب النموذج الشركة عدد إجابة خاطئة درجة الفئة اختبارات صحيحة زمن الاستجابة (المتوسط)
#32 Qwen3.5-Flash medium Qwen 1 5.3 1/3 146.5s
#33 GLM 5.1 medium Z.ai 1 5.3 1/3 29.8s
#35 MiMo-V2-Omni medium Xiaomi 1 3.0 0/3 55.1s
#37 Claude Opus 4.6 medium Anthropic 1 3.0 0/3 83.4s
#40 GPT-5.2 medium OpenAI 1 5.9 1/3 77.8s
#42 Claude Sonnet 4.6 none Anthropic 1 7.7 2/3 3.54s
#43 Qwen3.5-35B-A3B medium Qwen 1 4.1 0/3 88.3s
#47 Grok 4.20 medium X AI 1 5.3 1/3 27.0s
#48 Gemma 4 31B none Google 1 7.7 2/3 3.22s
#50 Hunter Alpha medium OpenRouter 1 3.0 0/3 10.5s
#52 Grok 4.1 Fast medium X AI 1 5.8 1/3 121.8s
#57 GPT-5 Nano medium OpenAI 1 5.2 1/3 204.0s
#59 Qwen3.5-Flash none Qwen 1 7.7 2/3 905ms
#63 Qwen3.5-35B-A3B none Qwen 1 7.7 2/3 485ms
#73 Mistral Small 4 medium Mistral 1 5.3 1/3 6.11s

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)

أفضل النماذج حسب التكلفة المهدرة التقديرية