Ranking de Tarefas de agentes
Veja quais modelos de IA vão melhor em Tarefas de agentes, quais permanecem confiáveis e onde aparecem as maiores diferenças. Ordenar por: Custo total ↓.
Modelos exibidos
15
Média de Pontuação de Tarefas de agentes
5.8
Melhor modelo
Claude Sonnet 5.5 10.0
380/380
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Pontuação de Tarefas de agentes | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #187 | Qwen3.7 Flash medium | Qwen | 5.2 | 6.6 | $0.076 | 0/1 | 149.0s |
| #165 | GPT-5.6 Luna low | OpenAI | 10.0 | 6.9 | $0.075 | 1/1 | 45.7s |
| #111 | GPT-6 Luna high | OpenAI | 5.2 | 7.7 | $0.074 | 0/1 | 82.8s |
| #372 | Command A+ low | Cohere | 2.8 | 3.0 | $0.073 | 0/1 | 128.5s |
| #141 | Qwen3.8 27B medium | Qwen | 4.7 | 7.2 | ~$0.073 | 0/1 | 187.9s |
| #252 | Ring 2.6 1t medium | Inclusionai | 3.0 | 5.7 | $0.072 | 0/1 | 21ms |
| #334 | KAT Coder AIR V2.5 none | Kwaipilot | 3.0 | 4.4 | $0.070 | 0/1 | 1.07s |
| #244 | Gemini 3.1 Flash Lite none | 5.0 | 5.9 | $0.069 | 0/1 | 43.8s | |
| #319 | Qwen3 Coder Next medium | Qwen | 5.0 | 4.7 | $0.069 | 0/1 | 151.4s |
| #349 | Grok 4.1 Fast medium | X AI | 0.0 | 3.9 | $0.069 | 0/0 | 0ms |
| #321 | GPT-5.4 Nano none | OpenAI | 3.9 | 4.6 | $0.068 | 0/1 | 45.4s |
| #304 | Qwen3 Coder Next none | Qwen | 3.9 | 4.9 | $0.065 | 0/1 | 208.4s |
| #363 | Command A+ medium | Cohere | 5.0 | 3.4 | $0.064 | 0/1 | 112.8s |
| #308 | MiMo-V2.5 none | Xiaomi | 3.9 | 4.9 | $0.063 | 0/1 | 124.2s |
| #144 | Qwen3.7 Flash high | Qwen | 4.7 | 7.2 | $0.063 | 0/1 | 135.9s |