AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

إخفاقات AI BENCHY

إخفاقات لم يتبع التعليمات

اكتشف أي نماذج الذكاء الاصطناعي تواجه لم يتبع التعليمات أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: اختبارات صحيحة ↑.

النماذج المعروضة

15

إجمالي الإخفاقات

180

النموذج الأكثر تأثرًا

LFM2-24B-A2B 2
الترتيب النموذج الشركة عدد لم يتبع التعليمات النتيجة اختبارات صحيحة زمن الاستجابة (المتوسط)
#57 GPT-5 Nano medium OpenAI 3 6.3 7/18 44.1s
#60 Gemma 4 26B A4B none Google 3 6.2 7/18 6.59s
#62 Gemini 2.5 Flash none Google 1 6.2 7/18 903ms
#63 Qwen3.5-35B-A3B none Qwen 2 6.1 7/18 3.82s
#65 MiMo-V2-Pro none Xiaomi 2 6.0 7/18 2.39s
#66 GPT-5.4 none OpenAI 1 5.9 7/18 1.51s
#68 gpt-oss-120b medium OpenAI 4 5.8 7/18 16.1s
#69 Kimi K2.6 none Moonshot AI 3 5.8 7/18 2.05s
#50 Hunter Alpha medium OpenRouter 2 6.7 8/18 10.3s
#54 Mercury 2 medium Inception 4 6.5 8/18 2.21s
#55 MiMo-V2-Omni none Xiaomi 2 6.5 8/18 1.99s
#58 GLM 5V Turbo none Z.ai 2 6.2 8/18 3.10s
#59 Qwen3.5-Flash none Qwen 1 6.2 8/18 3.25s
#44 GPT-5.4 Mini medium OpenAI 5 7.3 9/18 15.2s
#45 GPT-5 Mini medium OpenAI 4 7.0 9/18 24.0s

أفضل النماذج حسب عدد لم يتبع التعليمات

عدد لم يتبع التعليمات مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)