Programmation : N'a pas suivi les instructions
Programmation
N'a pas suivi les instructions
Voyez quels modèles d'IA ont le plus de chances de rencontrer N'a pas suivi les instructions sur Programmation, pour repérer plus vite les points faibles. Trier par: Temps de réponse (moy.) ↓.
Raisons d'échec
25/25
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de N'a pas suivi les instructions | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #126 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.2 | $1.273 | 1/3 | 266.7s |
| #54 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 6.3 | $0.134 | 1/3 | 252.7s |
| #42 | Qwen3.8 27B high | Qwen | 1 | 8.1 | ~$0.287 | 2/3 | 248.6s |
| #252 | Trinity Large Thinking high | Arcee AI | 1 | 3.7 | $0.624 | 0/3 | 245.0s |
| #283 | Ling 3.0 Tiny medium | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 212.0s |
| #176 | Trinity Large Thinking medium | Arcee AI | 1 | 7.5 | $0.798 | 2/3 | 179.0s |
| #279 | Ling 3.0 Tiny high | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 177.7s |
| #280 | Ling 3.0 Tiny low | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 170.7s |
| #95 | Qwen3.8 2.4T A95B high | Qwen | 1 | 5.9 | $2.357 | 1/3 | 160.5s |
| #282 | Qwen3.5-9B medium | Qwen | 1 | 2.9 | $0.062 | 0/3 | 100.9s |
| #203 | Kimi K2.6 none | Moonshot AI | 1 | 5.5 | $0.230 | 1/3 | 82.6s |
| #260 | Cobuddy medium | Baidu | 1 | 3.7 | $0.000 | 0/3 | 79.2s |
| #259 | Laguna M.1 medium | Poolside | 1 | 1.5 | $0.033 | 0/1 | 35.6s |
| #74 | Claude Opus 4.6 medium | Anthropic | 1 | 5.7 | $2.961 | 1/3 | 30.1s |
| #258 | Grok 4.1 Fast medium | X AI | 1 | 7.8 | $0.069 | 0/1 | 23.6s |