Échecs N'a pas suivi les instructions
Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir.
Catégories
Dans la catégorie Résolution d'énigmes128 Dans la catégorie Intelligence générale116 Dans la catégorie Suivi des instructions48 Dans la catégorie Astuces anti-IA44 Dans la catégorie Programmation29 Dans la catégorie Appel d'outils12 Dans la catégorie Analyse et extraction des données7 Dans la catégorie Spécifique au domaine2 Dans la catégorie Combiné1
216/216
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #46 | Muse Spark 1.1 medium | Meta | 2 | 8.6 | $1.420 | 15/22 | 26.2s |
| #50 | GPT-5.4 medium | OpenAI | 2 | 8.5 | $1.560 | 15/22 | 22.9s |
| #56 | Qwen3.8 27B high | Qwen | 2 | 8.4 | ~$0.287 | 16/22 | 167.9s |
| #58 | Inkling Small high | Thinkingmachines | 2 | 8.4 | $0.398 | 14/22 | 30.4s |
| #68 | Muse Spark 1.1 high | Meta | 2 | 8.0 | $2.253 | 12/22 | 36.9s |
| #70 | DeepSeek V4 Flash 0731 high | DeepSeek | 2 | 8.0 | $0.134 | 14/22 | 114.9s |
| #84 | Qwen3.8 27B medium | Qwen | 2 | 7.8 | ~$0.058 | 14/22 | 33.0s |
| #85 | Seed-2.0-Lite medium | Bytedance Seed | 2 | 7.8 | $0.236 | 13/22 | 47.9s |
| #91 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.454 | 10/22 | 92.5s |
| #92 | DeepSeek V4 Flash 0423 high | DeepSeek | 2 | 7.6 | $0.042 | 13/22 | 51.8s |
| #98 | GPT-5.4 Nano medium | OpenAI | 2 | 7.5 | $0.142 | 12/22 | 13.3s |
| #100 | MiniMax M3 medium | Minimax | 2 | 7.5 | $0.300 | 11/22 | 75.2s |
| #101 | GPT 5.3 Chat none | OpenAI | 2 | 7.5 | $0.533 | 13/22 | 6.56s |
| #103 | Qwen3.5-27B medium | Qwen | 2 | 7.5 | $0.982 | 13/22 | 113.3s |
| #113 | Qwen3.8 2.4T A95B high | Qwen | 2 | 7.4 | $2.357 | 14/22 | 120.6s |