Échecs N'a pas suivi les instructions
Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↑.
Catégories
Dans la catégorie Résolution d'énigmes128 Dans la catégorie Intelligence générale116 Dans la catégorie Suivi des instructions48 Dans la catégorie Astuces anti-IA44 Dans la catégorie Programmation29 Dans la catégorie Appel d'outils12 Dans la catégorie Analyse et extraction des données7 Dans la catégorie Spécifique au domaine2 Dans la catégorie Combiné1
216/216
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #153 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.210 | 9/22 | 11.7s |
| #163 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #166 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #192 | gpt-oss-120b medium | OpenAI | 3 | 6.1 | $0.020 | 9/22 | 20.8s |
| #194 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #199 | Gemma 4 31B none | 1 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #222 | Inkling Small low | Thinkingmachines | 2 | 5.7 | $0.055 | 9/22 | 2.07s |
| #231 | Gemma 4 26B A4B none | 2 | 5.6 | $0.015 | 9/22 | 7.58s | |
| #239 | Qwen3.8 27B none | Qwen | 1 | 5.5 | ~$0.006 | 9/22 | 3.12s |
| #277 | Ring-2.6-1T none | Inclusionai | 2 | 4.8 | $0.026 | 9/22 | 52.0s |
| #281 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #285 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #91 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.454 | 10/22 | 92.5s |
| #126 | Muse Glimmer 30B high | Meta | 3 | 7.2 | $0.397 | 10/22 | 66.7s |
| #139 | Mercury 2 medium | Inception | 3 | 7.0 | $0.094 | 10/22 | 2.95s |