Échecs N'a pas suivi les instructions
Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Nombre d'échecs ↑.
Catégories
Dans la catégorie Résolution d'énigmes128 Dans la catégorie Intelligence générale116 Dans la catégorie Suivi des instructions48 Dans la catégorie Astuces anti-IA44 Dans la catégorie Programmation29 Dans la catégorie Appel d'outils12 Dans la catégorie Analyse et extraction des données7 Dans la catégorie Spécifique au domaine2 Dans la catégorie Combiné1
216/216
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #140 | Grok 4.20 medium | X AI | 2 | 7.0 | $0.805 | 11/22 | 32.6s |
| #142 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.479 | 10/22 | 98.2s |
| #151 | Solar Pro 4 low | Upstage | 2 | 6.8 | $0.044 | 11/22 | 136.1s |
| #152 | Solar Pro 4 medium | Upstage | 2 | 6.8 | $0.047 | 12/22 | 127.6s |
| #153 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.210 | 9/22 | 11.7s |
| #155 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 6.8 | $0.221 | 11/22 | 48.7s |
| #163 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #166 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #171 | Mercury 2.5 Preview high | Inception | 2 | 6.6 | $0.030 | 12/22 | 4.01s |
| #176 | Gemini 3.1 Flash Lite Preview none | 2 | 6.4 | $0.052 | 12/22 | 1.56s | |
| #178 | Dots 3 Note Preview low | Dots Studio | 2 | 6.4 | $0.000 | 10/22 | 61.8s |
| #183 | Ring-2.6-1T medium | Inclusionai | 2 | 6.4 | $0.102 | 11/22 | 68.8s |
| #196 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.11s |
| #200 | Qwen3.5 Plus 2026-04-20 none | Qwen | 2 | 6.1 | $0.122 | 8/22 | 13.1s |
| #202 | Trinity Large Thinking low | Arcee AI | 2 | 6.0 | $0.625 | 8/22 | 96.6s |