Résolution d'énigmes : N'a pas suivi les instructions
Résolution d'énigmes
N'a pas suivi les instructions
Voyez quels modèles d'IA ont le plus de chances de rencontrer N'a pas suivi les instructions sur Résolution d'énigmes, pour repérer plus vite les points faibles.
Raisons d'échec
121/121
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #182 | Gemini 3.1 Flash Lite minimal | 2 | 6.0 | $0.047 | 1/3 | 2.15s | |
| #189 | Trinity Large Thinking medium | Arcee AI | 2 | 5.2 | $0.756 | 0/3 | 2.90s |
| #219 | Gemini 3.1 Flash Lite high | 2 | 5.7 | $2.044 | 1/3 | 50.8s | |
| #227 | Nemotron 3.5 Lightning high | NVIDIA | 2 | 3.6 | $0.134 | 0/3 | 6.09s |
| #246 | Qwen3.6 35B A3B none | Qwen | 2 | 3.2 | $0.051 | 0/3 | 1.07s |
| #258 | North Mini Code none | Cohere | 2 | 3.5 | $0.000 | 0/3 | 24.4s |
| #272 | Trinity Large Thinking high | Arcee AI | 2 | 4.7 | $0.592 | 0/3 | 3.84s |
| #25 | GPT-5.3-Codex medium | OpenAI | 1 | 9.0 | $0.988 | 2/3 | 5.05s |
| #26 | Muse Spark 1.3 high | Meta | 1 | 8.7 | $1.653 | 2/3 | 38.4s |
| #34 | GLM 5.3 Flash max | Z.ai | 1 | 8.7 | $0.059 | 2/3 | 5.61s |
| #36 | Muse Spark 1.2 high | Meta | 1 | 8.2 | $1.771 | 2/3 | 10.1s |
| #37 | Muse Spark 1.2 medium | Meta | 1 | 8.7 | $1.339 | 2/3 | 9.45s |
| #38 | Muse Spark 1.1 medium | Meta | 1 | 7.9 | $1.420 | 2/3 | 42.5s |
| #42 | GPT-5.4 medium | OpenAI | 1 | 8.2 | $1.560 | 2/3 | 9.14s |
| #44 | Muse Spark 1.2 low | Meta | 1 | 8.7 | $0.655 | 2/3 | 5.17s |