Échecs Mauvaise réponse
Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↓.
Catégories
Dans la catégorie Spécifique au domaine421 Dans la catégorie Astuces anti-IA293 Dans la catégorie Programmation259 Dans la catégorie Résolution d'énigmes204 Dans la catégorie Culture générale172 Dans la catégorie Combiné69 Dans la catégorie Intelligence générale62 Dans la catégorie Suivi des instructions61 Dans la catégorie Analyse et extraction des données41 Dans la catégorie Appel d'outils3
215/215
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Mauvaise réponse | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #47 | Claude Opus 4.6 medium | Anthropic | 3 | 7.7 | $3.059 | 13/22 | 34.3s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 6 | 7.7 | $0.041 | 13/22 | 49.7s |
| #55 | Nemotron 3 Ultra medium | NVIDIA | 7 | 7.5 | $0.774 | 13/22 | 32.2s |
| #58 | GPT-5.3 Chat none | OpenAI | 7 | 7.5 | $0.571 | 13/22 | 6.88s |
| #59 | GPT-5.6 Terra low | OpenAI | 8 | 7.5 | $0.519 | 13/22 | 5.31s |
| #62 | Qwen3.5-27B medium | Qwen | 4 | 7.4 | $1.627 | 13/22 | 111.9s |
| #68 | Gemini 3.1 Flash Lite Preview medium | 7 | 7.3 | $0.115 | 13/22 | 4.61s | |
| #69 | Gemini 3.1 Flash Lite medium | 7 | 7.3 | $0.117 | 13/22 | 4.27s | |
| #70 | Claude Opus 4.8 none | Anthropic | 4 | 7.3 | $1.166 | 13/22 | 4.91s |
| #74 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 8 | 7.2 | $0.317 | 13/22 | 46.4s |
| #77 | Grok 4.3 medium | X AI | 5 | 7.1 | $0.779 | 13/22 | 47.4s |
| #78 | GLM 5.1 medium | Z.ai | 4 | 7.1 | $0.535 | 13/22 | 46.8s |
| #93 | Gemini 3 Flash Preview none | 8 | 6.8 | $0.085 | 13/22 | 2.95s | |
| #94 | Qwen3.6 35B A3B medium | Qwen | 4 | 6.7 | $0.746 | 13/22 | 58.1s |
| #110 | Gemini 3.1 Flash Lite Preview low | 7 | 6.5 | $0.646 | 13/22 | 16.7s |