AI BENCHY
Your ad here

Échecs AI BENCHY

Échecs Mauvaise réponse

Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir. Trier par: Temps de réponse (moy.) ↑.

Modèles affichés

15

Échecs totaux

572

Modèle le plus touché

Mercury 2 13
Rang Modèle Entreprise Nombre de Mauvaise réponse Score Tests corrects Temps de réponse (moy.)
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#12 Gemini 3 PRO Preview medium Google 3 8.4 14/18 9.06s
#56 Grok 4.20 Multi Agent Beta medium X AI 3 6.4 7/18 9.80s
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#87 Qwen3 Coder Next none Qwen 12 5.1 4/18 10.2s
#47 Grok 4.20 medium X AI 3 7.0 9/18 10.3s
#50 Hunter Alpha medium OpenRouter 4 6.7 8/18 10.3s
#92 Qwen3 Coder Next medium Qwen 9 4.7 3/18 10.8s
#38 GPT-5.4 Nano medium OpenAI 4 7.6 11/18 11.2s
#84 gpt-oss-120b none OpenAI 6 5.2 4/18 12.0s
#64 DeepSeek V3.2 none DeepSeek 8 6.1 7/18 12.1s
#15 Gemini 2.5 Flash medium Google 4 8.2 13/18 12.1s
#23 MiMo-V2-Pro medium Xiaomi 3 8.1 12/18 12.3s
#26 Claude Sonnet 4.6 medium Anthropic 2 8.0 13/18 12.7s
#76 Kimi K2.5 none Moonshot AI 12 5.5 6/18 13.4s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)