Échecs N'a pas suivi les instructions
Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↑.
Catégories
141/141
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #152 | Owl Alpha medium | Openrouter | 2 | 5.6 | $0.000 | 8/21 | 11.9s |
| #163 | Mimo V2 Omni none | Xiaomi | 1 | 5.5 | $0.021 | 8/21 | 2.44s |
| #102 | LongCat 2.0 high | Meituan | 2 | 6.6 | $0.469 | 9/22 | 148.7s |
| #127 | gpt-oss-120b medium | OpenAI | 3 | 6.1 | $0.019 | 9/22 | 21.9s |
| #128 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #134 | GPT-5 Nano medium | OpenAI | 2 | 6.1 | $0.114 | 9/22 | 54.9s |
| #185 | Ring-2.6-1T none | Inclusionai | 2 | 4.8 | $0.026 | 9/22 | 55.1s |
| #187 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #190 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #50 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.200 | 10/22 | 79.1s |
| #81 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.600 | 10/22 | 99.0s |
| #82 | Mercury 2 medium | Inception | 3 | 7.0 | $0.093 | 10/22 | 2.72s |
| #86 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.9 | $0.096 | 10/22 | 11.6s |
| #96 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.391 | 10/22 | 100.3s |
| #105 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.779 | 10/22 | 106.3s |