Échecs Mauvaise réponse
Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir.
Catégories
Dans la catégorie Spécifique au domaine654 Dans la catégorie Astuces anti-IA386 Dans la catégorie Programmation361 Dans la catégorie Résolution d'énigmes275 Dans la catégorie Culture générale244 Dans la catégorie Combiné95 Dans la catégorie Intelligence générale90 Dans la catégorie Suivi des instructions82 Dans la catégorie Analyse et extraction des données66 Dans la catégorie Appel d'outils5
309/309
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Mauvaise réponse | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #205 | Hy3 preview high | Tencent | 3 | 5.9 | $0.135 | 11/21 | 56.6s |
| #228 | Hy4 preview low | Tencent | 3 | 5.6 | $1.745 | 3/22 | 214.3s |
| #3 | Gemini 3.7 Flash high | 2 | 9.8 | $0.646 | 20/22 | 12.2s | |
| #4 | Gemini 3.6 Flash medium | 2 | 9.8 | $0.427 | 20/22 | 11.9s | |
| #6 | Gemini 3 Flash Preview medium | 2 | 9.5 | $0.763 | 20/22 | 19.9s | |
| #7 | Gemini 3.5 Flash high | 2 | 9.4 | $2.011 | 19/22 | 15.5s | |
| #8 | Gemini 3.7 Flash medium | 2 | 9.4 | $0.309 | 20/22 | 5.87s | |
| #12 | Grok 4.6 high | X AI | 2 | 9.3 | $1.908 | 19/22 | 84.1s |
| #13 | Gemini 3.1 Pro Preview medium | 2 | 9.2 | $1.352 | 20/22 | 20.6s | |
| #14 | Gemini 3.7 Flash low | 2 | 9.2 | $0.207 | 20/22 | 3.85s | |
| #15 | Claude Opus 5 high | Anthropic | 2 | 9.2 | $3.070 | 18/22 | 22.5s |
| #17 | Gemini 3.8 Flash medium | 2 | 9.1 | $0.653 | 19/22 | 14.5s | |
| #24 | Grok 4.5 high | X AI | 2 | 9.0 | $2.252 | 17/22 | 72.3s |
| #34 | GLM 5.3 Flash max | Z.ai | 2 | 8.7 | $0.059 | 16/22 | 52.1s |
| #48 | Qwen3.8 27B high | Qwen | 2 | 8.4 | ~$0.287 | 16/22 | 167.9s |