AI BENCHY
Your ad here

Échecs AI BENCHY

Échecs Mauvaise réponse

Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↓.

Modèles affichés

15

Échecs totaux

572

Modèle le plus touché

Gemini 3.1 Pro Preview 1
Rang Modèle Entreprise Nombre de Mauvaise réponse Score Tests corrects Temps de réponse (moy.)
#75 GLM 5.1 none Z.ai 10 5.6 5/18 4.33s
#78 Trinity Large Preview none Arcee AI 11 5.3 5/18 5.07s
#81 Elephant medium Openrouter 9 5.2 5/18 1.27s
#82 Grok 4.20 none X AI 9 5.2 5/18 1.11s
#83 Mistral Small 4 none Mistral 11 5.2 5/18 665ms
#85 Elephant none Openrouter 9 5.2 5/18 1.23s
#86 GPT-5.4 Mini none OpenAI 10 5.1 5/18 1.17s
#79 Grok 4.20 Beta none X AI 10 5.3 4/18 1.19s
#80 MiniMax M2.7 medium Minimax 5 5.3 4/18 31.1s
#84 gpt-oss-120b none OpenAI 6 5.2 4/18 12.0s
#87 Qwen3 Coder Next none Qwen 12 5.1 4/18 10.2s
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#89 GPT-4o-mini none OpenAI 13 4.9 4/18 2.00s
#90 Qwen3.5-9B none Qwen 10 4.8 4/18 1.47s
#91 Mercury 2 none Inception 13 4.8 4/18 613ms

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)