AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs AI BENCHY

Échecs N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↓.

Modèles affichés

15

Échecs totaux

180

Modèle le plus touché

Qwen3.6 Plus Preview 1
Rang Modèle Entreprise Nombre de N'a pas suivi les instructions Score Tests corrects Temps de réponse (moy.)
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#27 DeepSeek V3.2 medium DeepSeek 1 8.0 12/18 46.4s
#28 GPT-5.2 Chat none OpenAI 1 7.9 12/18 6.84s
#29 Gemini 3.1 Flash Lite Preview none Google 2 7.9 12/18 1.30s
#30 Step 3.5 Flash medium Stepfun 3 7.9 11/17 26.8s
#31 GLM 5V Turbo medium Z.ai 2 7.8 11/18 15.0s
#32 Qwen3.5-Flash medium Qwen 1 7.8 11/18 66.7s
#34 Kimi K2.6 medium Moonshot AI 3 7.7 11/18 45.2s
#35 MiMo-V2-Omni medium Xiaomi 2 7.7 11/18 16.8s
#36 GPT-5.3 Chat none OpenAI 2 7.7 11/18 5.88s
#38 GPT-5.4 Nano medium OpenAI 3 7.6 11/18 11.2s
#39 Seed-2.0-Mini medium Bytedance Seed 1 7.5 11/18 69.7s
#40 GPT-5.2 medium OpenAI 3 7.5 11/18 14.0s
#41 MiMo-V2-Flash medium Xiaomi 1 7.5 11/18 23.4s
#42 Claude Sonnet 4.6 none Anthropic 1 7.4 11/18 4.98s

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)