Échecs N'a pas suivi les instructions
Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↑.
Catégories
Dans la catégorie Résolution d'énigmes128 Dans la catégorie Intelligence générale116 Dans la catégorie Suivi des instructions48 Dans la catégorie Astuces anti-IA44 Dans la catégorie Programmation29 Dans la catégorie Appel d'outils12 Dans la catégorie Analyse et extraction des données7 Dans la catégorie Spécifique au domaine2 Dans la catégorie Combiné1
216/216
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #55 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $1.182 | 14/22 | 28.5s |
| #58 | Inkling Small high | Thinkingmachines | 2 | 8.4 | $0.398 | 14/22 | 30.4s |
| #70 | DeepSeek V4 Flash 0731 high | DeepSeek | 2 | 8.0 | $0.134 | 14/22 | 114.9s |
| #71 | GLM 5.2 high | Z.ai | 1 | 8.0 | $1.188 | 14/22 | 69.9s |
| #80 | Gemini 3.5 Flash Lite medium | 1 | 7.8 | $0.272 | 14/22 | 5.12s | |
| #84 | Qwen3.8 27B medium | Qwen | 2 | 7.8 | ~$0.058 | 14/22 | 33.0s |
| #108 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.4 | $0.117 | 14/22 | 4.59s | |
| #113 | Qwen3.8 2.4T A95B high | Qwen | 2 | 7.4 | $2.357 | 14/22 | 120.6s |
| #167 | Gemini 3.1 Flash Lite Preview low | 1 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #93 | GLM 5 Turbo medium | Z.ai | 1 | 7.6 | $0.323 | 14/21 | 23.0s |
| #175 | Hy3 preview medium | Tencent | 1 | 6.5 | $0.049 | 14/21 | 16.3s |
| #46 | Muse Spark 1.1 medium | Meta | 2 | 8.6 | $1.420 | 15/22 | 26.2s |
| #50 | GPT-5.4 medium | OpenAI | 2 | 8.5 | $1.560 | 15/22 | 22.9s |
| #52 | Muse Spark 1.2 low | Meta | 3 | 8.4 | $0.655 | 15/22 | 9.77s |
| #57 | Seed 2.1 Turbo medium | Bytedance Seed | 1 | 8.4 | $1.951 | 15/22 | 193.6s |