Intelligence générale : N'a pas suivi les instructions
Intelligence générale
N'a pas suivi les instructions
Voyez quels modèles d'IA ont le plus de chances de rencontrer N'a pas suivi les instructions sur Intelligence générale, pour repérer plus vite les points faibles.
Raisons d'échec
78/78
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #56 | GPT-5.4 Mini medium | OpenAI | 1 | 4.5 | $0.756 | 0/1 | 3.72s |
| #58 | Qwen3.5-27B medium | Qwen | 1 | 6.1 | $1.627 | 0/1 | 101.4s |
| #63 | Claude Sonnet 4.6 none | Anthropic | 1 | 6.1 | $0.661 | 0/1 | 2.56s |
| #71 | Qwen3.7 Plus none | Qwen | 1 | 5.3 | $0.106 | 0/1 | 1.33s |
| #73 | Grok 4.3 medium | X AI | 1 | 5.4 | $0.779 | 0/1 | 24.7s |
| #75 | Grok 4.20 medium | X AI | 1 | 3.9 | $0.777 | 0/1 | 24.5s |
| #77 | Kimi K2.5 medium | Moonshot AI | 1 | 6.5 | $0.600 | 0/1 | 69.7s |
| #78 | Mercury 2 medium | Inception | 1 | 4.8 | $0.093 | 0/1 | 821ms |
| #80 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 5.1 | $0.101 | 0/1 | 36.7s |
| #81 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 4.7 | $0.467 | 0/1 | 2.35s |
| #84 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 5.5 | $0.187 | 0/1 | 4.02s |
| #90 | Qwen3.6 35B A3B medium | Qwen | 1 | 4.4 | $0.746 | 0/1 | 8.66s |
| #99 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.779 | 0/1 | 39.5s |
| #101 | MiMo-V2.5 medium | Xiaomi | 1 | 5.4 | $0.082 | 0/1 | 5.37s |
| #103 | Qwen3.5-27B none | Qwen | 1 | 5.0 | $0.090 | 0/1 | 2.51s |