Résolution d'énigmes : N'a pas suivi les instructions
Résolution d'énigmes
N'a pas suivi les instructions
Voyez quels modèles d'IA ont le plus de chances de rencontrer N'a pas suivi les instructions sur Résolution d'énigmes, pour repérer plus vite les points faibles. Trier par: Nombre d'échecs ↑.
Raisons d'échec
86/86
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #13 | GPT-5.3-Codex medium | OpenAI | 1 | 9.0 | $0.920 | 2/3 | 5.05s |
| #16 | Muse Spark 1.1 medium | Meta | 1 | 7.9 | $1.357 | 2/3 | 42.5s |
| #18 | GPT-5.4 medium | OpenAI | 1 | 8.2 | $1.533 | 2/3 | 9.14s |
| #21 | GPT-5.2 medium | OpenAI | 1 | 7.5 | $0.951 | 2/3 | 5.80s |
| #24 | Muse Spark 1.1 low | Meta | 1 | 8.3 | $0.647 | 2/3 | 6.60s |
| #26 | GPT-5 Mini medium | OpenAI | 1 | 5.6 | $0.237 | 1/3 | 15.2s |
| #28 | Inkling high | Thinkingmachines | 1 | 6.9 | $1.006 | 1/3 | 10.7s |
| #31 | GLM 5.2 high | Z.ai | 1 | 6.0 | $0.970 | 1/3 | 33.7s |
| #35 | Seed-2.0-Lite medium | Bytedance Seed | 1 | 9.0 | $0.234 | 2/3 | 10.2s |
| #45 | DeepSeek V4 Flash high | DeepSeek | 1 | 8.2 | $0.042 | 2/3 | 26.1s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 1 | 6.9 | $0.200 | 1/3 | 56.8s |
| #49 | GLM 5 Turbo medium | Z.ai | 1 | 8.7 | $0.323 | 2/3 | 5.23s |
| #52 | Kimi K2.7 Code medium | Moonshot AI | 1 | 5.9 | $0.751 | 1/3 | 41.0s |
| #53 | GPT-5.4 Nano medium | OpenAI | 1 | 4.1 | $0.138 | 0/3 | 3.79s |
| #56 | GPT-5.4 Mini medium | OpenAI | 1 | 7.8 | $0.756 | 2/3 | 4.37s |