Échecs AI BENCHY
Échecs Mauvaise réponse
Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir. Trier par: Temps de réponse (moy.) ↓.
Catégories
Dans la catégorie Spécifique au domaine182 Dans la catégorie Astuces anti-IA165 Dans la catégorie Résolution d'énigmes85 Dans la catégorie Suivi des instructions44 Dans la catégorie Combiné37 Dans la catégorie Programmation28 Dans la catégorie Analyse et extraction des données19 Dans la catégorie Intelligence générale10 Dans la catégorie Appel d'outils2
| Rang | Modèle | Entreprise | Nombre de Mauvaise réponse | Score | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|
| #75 | GLM 5.1 none | Z.ai | 10 | 5.6 | 5/18 | 4.33s |
| #53 | GLM 5 none | Z.ai | 9 | 6.6 | 9/18 | 4.23s |
| #48 | Gemma 4 31B none | 5 | 6.9 | 10/18 | 4.02s | |
| #63 | Qwen3.5-35B-A3B none | Qwen | 9 | 6.1 | 7/18 | 3.82s |
| #17 | Gemini 3.1 Flash Lite Preview medium | 4 | 8.2 | 13/18 | 3.74s | |
| #70 | Qwen3.5-122B-A10B none | Qwen | 11 | 5.7 | 6/18 | 3.69s |
| #3 | Claude Opus 4.7 medium | Anthropic | 1 | 9.2 | 16/18 | 3.53s |
| #74 | GLM 4.7 Flash none | Z.ai | 10 | 5.6 | 5/18 | 3.35s |
| #59 | Qwen3.5-Flash none | Qwen | 9 | 6.2 | 8/18 | 3.25s |
| #22 | Gemini 3.1 Flash Lite Preview low | 4 | 8.1 | 13/18 | 3.22s | |
| #4 | Claude Opus 4.7 none | Anthropic | 2 | 9.2 | 16/18 | 3.13s |
| #58 | GLM 5V Turbo none | Z.ai | 8 | 6.2 | 8/18 | 3.10s |
| #77 | GLM 5 Turbo none | Z.ai | 10 | 5.5 | 6/18 | 2.94s |
| #94 | MiMo-V2-Flash none | Xiaomi | 12 | 4.5 | 3/18 | 2.79s |
| #49 | Qwen3.5 Plus 2026-02-15 none | Qwen | 9 | 6.8 | 9/18 | 2.60s |