AI BENCHY
AD
Track all your projects in one dashboard. Get ๐Ÿ“Šstats, ๐Ÿ”ฅheatmaps and ๐Ÿ‘€recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Fouten

Instructies niet gevolgd-fouten

Zie welke AI-modellen het vaakst tegen Instructies niet gevolgd aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Correcte tests โ†‘.

Getoonde modellen

15

Totaal fouten

180

Meest getroffen model

LFM2-24B-A2B 2
Rang Model Bedrijf Instructies niet gevolgd-aantal Score Correcte tests Responstijd (gem.)
#46 Kimi K2.5 medium Moonshot AI 2 7.0 9/18 72.4s
#47 Grok 4.20 medium X AI 4 7.0 9/18 10.3s
#51 Nemotron 3 Super medium NVIDIA 4 6.7 9/18 19.1s
#52 Grok 4.1 Fast medium X AI 4 6.7 9/18 23.9s
#48 Gemma 4 31B none Google 1 6.9 10/18 4.02s
#31 GLM 5V Turbo medium Z.ai 2 7.8 11/18 15.0s
#32 Qwen3.5-Flash medium Qwen 1 7.8 11/18 66.7s
#34 Kimi K2.6 medium Moonshot AI 3 7.7 11/18 45.2s
#35 MiMo-V2-Omni medium Xiaomi 2 7.7 11/18 16.8s
#36 GPT-5.3 Chat none OpenAI 2 7.7 11/18 5.88s
#38 GPT-5.4 Nano medium OpenAI 3 7.6 11/18 11.2s
#39 Seed-2.0-Mini medium Bytedance Seed 1 7.5 11/18 69.7s
#40 GPT-5.2 medium OpenAI 3 7.5 11/18 14.0s
#41 MiMo-V2-Flash medium Xiaomi 1 7.5 11/18 23.4s
#42 Claude Sonnet 4.6 none Anthropic 1 7.4 11/18 4.98s

Topmodellen op Instructies niet gevolgd-aantal

Instructies niet gevolgd-aantal vs Score

Topmodellen op Responstijd (gem.)