AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs AI BENCHY

Échecs Mauvaise réponse

Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir.

Modèles affichés

15

Échecs totaux

1204

Modèle le plus touché

Mercury 2 16
Rang Modèle Entreprise Nombre de Mauvaise réponse Score Tests corrects Temps de réponse (moy.)
#30 Qwen3.5-27B medium Qwen 4 7.8 13/21 68.4s
#46 Qwen3.6 35B A3B medium Qwen 4 7.4 13/21 18.1s
#49 Qwen3.5-Flash medium Qwen 4 7.4 12/21 63.3s
#52 Claude Sonnet 4.6 medium Anthropic 4 7.4 13/21 17.1s
#53 Gemini 3.1 Flash Lite high Google 4 7.3 10/18 62.0s
#55 GLM 5.1 medium Z.ai 4 7.3 12/21 33.7s
#62 Step 3.5 Flash medium Stepfun 4 7.2 11/20 72.5s
#68 Claude Opus 4.8 none Anthropic 4 7.0 12/21 3.47s
#73 Seed-2.0-Mini medium Bytedance Seed 4 6.9 11/21 80.2s
#79 Hunter Alpha medium OpenRouter 4 6.7 8/18 10.3s
#84 Grok 4.20 Multi Agent Beta medium X AI 4 6.6 8/18 9.69s
#86 Grok 4.1 Fast medium X AI 4 6.5 9/19 23.8s
#89 Hy3 preview low Tencent 4 6.4 10/21 24.6s
#92 Laguna M.1 medium Poolside 4 6.4 9/19 14.7s
#103 DeepSeek V4 Pro high DeepSeek 4 6.0 8/21 65.2s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)