Ranking de Seguimento de instruções
Veja quais modelos de IA vão melhor em Seguimento de instruções, quais permanecem confiáveis e onde aparecem as maiores diferenças. Ordenar por: Custo total ↓.
Modelos exibidos
15
Média de Pontuação de Seguimento de instruções
8.5
Melhor modelo
Grok 4.20 Multi Agent Beta 9.8
343/343
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Pontuação de Seguimento de instruções | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #114 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 10.0 | 7.5 | $0.459 | 2/2 | 31.9s |
| #178 | GLM 5V Turbo medium | Z.ai | 9.9 | 6.7 | $0.457 | 2/2 | 3.74s |
| #36 | Gemini 3.5 Flash low | 9.9 | 8.8 | $0.449 | 2/2 | 1.86s | |
| #127 | Grok 4.6 low | X AI | 9.8 | 7.4 | $0.449 | 2/2 | 6.64s |
| #15 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $0.446 | 2/2 | 2.73s |
| #139 | Muse Glimmer 30B high | Meta | 8.4 | 7.2 | $0.430 | 1/2 | 8.62s |
| #7 | Gemini 3.6 Flash medium | 10.0 | 9.8 | $0.427 | 2/2 | 3.82s | |
| #100 | DeepSeek V4 Pro high | DeepSeek | 7.8 | 7.7 | $0.424 | 1/2 | 8.73s |
| #110 | GPT-5.6 Terra low | OpenAI | 10.0 | 7.5 | $0.420 | 2/2 | 1.48s |
| #88 | Qwen3.6 Plus medium | Qwen | 10.0 | 7.8 | $0.418 | 2/2 | 7.54s |
| #176 | LongCat 2.0 low | Meituan | 6.5 | 6.7 | $0.412 | 1/2 | 6.39s |
| #131 | KAT-Coder-Pro V2.5 low | Kwaipilot | 10.0 | 7.3 | $0.400 | 2/2 | 2.53s |
| #63 | Inkling Small high | Thinkingmachines | 9.8 | 8.4 | $0.398 | 2/2 | 3.94s |
| #236 | GPT-5.4 none | OpenAI | 6.5 | 5.8 | $0.397 | 1/2 | 1.07s |
| #145 | Step 3.7 Flash low | Stepfun | 9.8 | 7.1 | $0.390 | 2/2 | 1.58s |