Classement Suivi des instructions
Voyez quels modèles d'IA réussissent le mieux sur Suivi des instructions, lesquels restent fiables et où les écarts sont les plus marqués. Trier par: Coût total ↓.
Modèles affichés
15
Moyenne de Score Suivi des instructions
8.5
Meilleur modèle
Grok 4.20 Multi Agent Beta 9.8
319/319
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Score Suivi des instructions | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #158 | GLM 5.2 none | Z.ai | 9.8 | 6.7 | $0.153 | 2/2 | 3.84s |
| #209 | Qwen3.5-35B-A3B none | Qwen | 6.3 | 5.9 | $0.151 | 1/2 | 809ms |
| #251 | Seed-2.0-Code none | Bytedance Seed | 6.2 | 5.3 | $0.151 | 1/2 | 1.80s |
| #256 | Inkling none | Thinkingmachines | 6.3 | 5.2 | $0.147 | 1/2 | 1.72s |
| #131 | Muse Glimmer 30B low | Meta | 8.4 | 7.1 | $0.143 | 1/2 | 3.60s |
| #98 | GPT-5.4 Nano medium | OpenAI | 9.8 | 7.5 | $0.142 | 2/2 | 1.88s |
| #195 | Qwen3.5-Flash medium | Qwen | 10.0 | 6.1 | $0.142 | 2/2 | 63.5s |
| #278 | Nemotron 3.5 Lightning low | NVIDIA | 8.4 | 4.8 | $0.140 | 1/2 | 5.46s |
| #165 | Gemini 3.5 Flash Lite low | 9.8 | 6.6 | $0.138 | 2/2 | 1.75s | |
| #213 | Hy3 preview high | Tencent | 10.0 | 5.9 | $0.135 | 2/2 | 34.4s |
| #70 | DeepSeek V4 Flash 0731 high | DeepSeek | 9.8 | 8.0 | $0.134 | 2/2 | 4.46s |
| #235 | Nemotron 3.5 Lightning high | NVIDIA | 8.5 | 5.6 | $0.134 | 1/2 | 4.98s |
| #210 | Step 3.5 Flash medium | Stepfun | 8.3 | 5.9 | $0.132 | 1/2 | 4.78s |
| #200 | Qwen3.5 Plus 2026-04-20 none | Qwen | 6.2 | 6.1 | $0.122 | 1/2 | 1.17s |
| #120 | Gemini 3.1 Flash Lite medium | 9.9 | 7.3 | $0.120 | 2/2 | 2.59s |