AI BENCHY
Advertise here

إخفاقات الفئات في AI BENCHY

الذكاء العام: لم يتبع التعليمات

الذكاء العام
لم يتبع التعليمات

اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في الذكاء العام، حتى ترصد نقاط الضعف بسرعة أكبر.

النماذج المعروضة

15

إجمالي الإخفاقات

74

النموذج الأكثر تأثرًا

GPT-5.3-Codex 1
الترتيب النموذج الشركة عدد لم يتبع التعليمات درجة الفئة اختبارات صحيحة زمن الاستجابة (المتوسط)
#15 GPT-5.3-Codex medium OpenAI 1 4.6 0/1 4.87s
#17 GLM 5 medium Z.ai 1 6.1 0/1 14.7s
#19 Seed-2.0-Lite medium Bytedance Seed 1 6.7 0/1 18.2s
#21 GPT-5.4 medium OpenAI 1 4.7 0/1 4.92s
#24 GPT-5.2 Chat none OpenAI 1 4.4 0/1 3.20s
#26 Qwen3.6 Plus medium Qwen 1 5.1 0/1 27.1s
#28 Gemini 2.5 Flash medium Google 1 4.8 0/1 4.86s
#30 Qwen3.5-27B medium Qwen 1 6.1 0/1 101.4s
#31 DeepSeek V4 Flash high DeepSeek 1 6.1 0/1 25.2s
#38 Grok 4.3 medium X AI 1 5.4 0/1 24.7s
#42 GPT-5.2 medium OpenAI 1 3.7 0/1 4.32s
#43 MiMo-V2.5-Pro medium Xiaomi 1 5.5 0/1 4.02s
#45 GPT-5.4 Mini medium OpenAI 1 4.5 0/1 3.72s
#46 Qwen3.6 35B A3B medium Qwen 1 4.4 0/1 8.66s
#49 Qwen3.5-Flash medium Qwen 1 6.1 0/1 40.1s

أفضل النماذج حسب عدد لم يتبع التعليمات

عدد لم يتبع التعليمات مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)

أفضل النماذج حسب التكلفة المهدرة التقديرية