Ranking de Tarefas de agentes
Veja quais modelos de IA vão melhor em Tarefas de agentes, quais permanecem confiáveis e onde aparecem as maiores diferenças. Ordenar por: Tempo de resposta (médio) ↓.
380/380
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Pontuação de Tarefas de agentes | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #70 | Muse Glimmer 30B xhigh | Meta | 10.0 | 8.4 | $0.724 | 1/1 | 145.1s |
| #107 | Qwen3.7 Plus none | Qwen | 10.0 | 7.8 | $0.184 | 1/1 | 143.1s |
| #280 | Granite 4.2 8B low | IBM Granite | 6.1 | 5.3 | $0.036 | 0/1 | 142.7s |
| #263 | Qwen3.5-35B-A3B none | Qwen | 3.9 | 5.6 | $0.213 | 0/1 | 141.2s |
| #342 | gpt-oss-120b none | OpenAI | 6.1 | 4.2 | $0.016 | 0/1 | 140.9s |
| #257 | Dots 3 Note Preview medium | Dots Studio | 4.7 | 5.7 | $0.000 | 0/1 | 140.5s |
| #120 | Seed-2.0-Code high | Bytedance Seed | 10.0 | 7.5 | $1.448 | 1/1 | 139.9s |
| #111 | Muse Glimmer 30B high | Meta | 10.0 | 7.7 | $0.625 | 1/1 | 139.7s |
| #264 | Nemotron 3 Super medium | NVIDIA | 4.7 | 5.5 | $0.081 | 0/1 | 138.3s |
| #65 | Qwen3.7 Max medium | Qwen | 6.1 | 8.5 | $2.046 | 0/1 | 137.0s |
| #61 | Qwen3.8 Max (0902) low | Qwen | 6.1 | 8.6 | $1.131 | 0/1 | 136.0s |
| #143 | Qwen3.7 Flash high | Qwen | 4.7 | 7.2 | $0.063 | 0/1 | 135.9s |
| #217 | Qwen3.5 Plus 2026-04-20 none | Qwen | 7.4 | 6.3 | $0.226 | 0/1 | 133.3s |
| #54 | Qwen3.8 27B high | Qwen | 10.0 | 8.7 | ~$0.298 | 1/1 | 132.3s |
| #189 | Step 3.7 Flash high | Stepfun | 5.4 | 6.6 | $1.350 | 0/1 | 130.4s |