AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs AI BENCHY

Échecs Mauvaise réponse

Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir. Trier par: Nombre d'échecs ↑.

Modèles affichés

7

Échecs totaux

572

Modèle le plus touché

Gemini 3.1 Pro Preview 1
Rang Modèle Entreprise Nombre de Mauvaise réponse Score Tests corrects Temps de réponse (moy.)
#76 Kimi K2.5 none Moonshot AI 12 5.5 6/18 13.4s
#87 Qwen3 Coder Next none Qwen 12 5.1 4/18 10.2s
#94 MiMo-V2-Flash none Xiaomi 12 4.5 3/18 2.79s
#89 GPT-4o-mini none OpenAI 13 4.9 4/18 2.00s
#91 Mercury 2 none Inception 13 4.8 4/18 613ms
#95 Grok 4.1 Fast none X AI 13 4.5 3/18 1.76s
#96 GPT-5.4 Nano none OpenAI 13 4.5 2/18 1.40s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)