Échecs N'a pas suivi les instructions
Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↑.
Catégories
Dans la catégorie Résolution d'énigmes128 Dans la catégorie Intelligence générale116 Dans la catégorie Suivi des instructions48 Dans la catégorie Astuces anti-IA44 Dans la catégorie Programmation29 Dans la catégorie Appel d'outils12 Dans la catégorie Analyse et extraction des données7 Dans la catégorie Spécifique au domaine2 Dans la catégorie Combiné1
216/216
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #242 | Laguna S 2.1 medium | Poolside | 1 | 5.4 | $0.053 | 4/22 | 58.4s |
| #247 | DeepSeek V4 Flash 0731 none | DeepSeek | 2 | 5.4 | $0.021 | 4/22 | 20.7s |
| #248 | Laguna S 2.1 high | Poolside | 1 | 5.4 | $0.114 | 4/22 | 111.6s |
| #252 | Ling-2.6-1T none | Inclusionai | 2 | 5.3 | $0.016 | 4/22 | 8.59s |
| #254 | Qwen3.6 35B A3B none | Qwen | 2 | 5.3 | $0.051 | 4/22 | 5.57s |
| #264 | Qwen3.5-9B none | Qwen | 2 | 5.1 | $0.021 | 4/22 | 19.2s |
| #266 | North Mini Code none | Cohere | 2 | 5.1 | $0.000 | 4/22 | 29.9s |
| #273 | Mercury 2.5 Preview none | Inception | 1 | 4.9 | $0.018 | 4/22 | 3.51s |
| #279 | GPT-5.4 Nano none | OpenAI | 2 | 4.8 | $0.041 | 4/22 | 2.56s |
| #289 | Mercury 2 none | Inception | 1 | 4.7 | $0.030 | 4/22 | 825ms |
| #297 | GLM 4.7 Flash medium | Z.ai | 2 | 4.3 | $0.168 | 4/22 | 134.3s |
| #309 | Ling 3.0 Tiny high | Inclusionai | 3 | 3.8 | $0.000 | 4/22 | 75.7s |
| #310 | Ling 3.0 Tiny low | Inclusionai | 4 | 3.8 | $0.000 | 4/22 | 66.2s |
| #313 | Ling 3.0 Tiny medium | Inclusionai | 4 | 3.8 | $0.000 | 4/22 | 68.1s |
| #284 | Trinity Large Preview none | Arcee AI | 3 | 4.8 | $0.008 | 4/21 | 2.98s |