Ranking de Tarefas de agentes
Veja quais modelos de IA vão melhor em Tarefas de agentes, quais permanecem confiáveis e onde aparecem as maiores diferenças. Ordenar por: Custo total ↑.
Modelos exibidos
15
Média de Pontuação de Tarefas de agentes
5.8
Melhor modelo
Space Bunny Alpha 10.0
380/380
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Pontuação de Tarefas de agentes | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #158 | Qwen3.5-122B-A10B medium | Qwen | 6.1 | 7.0 | $1.152 | 0/1 | 95.3s |
| #62 | Claude Sonnet 5.5 high | Anthropic | 10.0 | 8.6 | $1.175 | 1/1 | 51.5s |
| #185 | GPT-5.5 none | OpenAI | 5.0 | 6.6 | $1.212 | 0/1 | 57.5s |
| #212 | Qwen3.5-35B-A3B medium | Qwen | 7.4 | 6.3 | $1.249 | 0/1 | 126.8s |
| #72 | Inkling high | Thinkingmachines | 10.0 | 8.4 | $1.250 | 1/1 | 66.0s |
| #125 | Seed-2.0-Code medium | Bytedance Seed | 10.0 | 7.4 | $1.275 | 1/1 | 91.7s |
| #101 | Gemini 3.5 Flash medium | 2.8 | 7.9 | $1.316 | 0/1 | 84.5s | |
| #34 | GPT-5.3-Codex medium | OpenAI | 10.0 | 9.1 | $1.318 | 1/1 | 61.9s |
| #168 | Kimi K2.6 medium | Moonshot AI | 5.0 | 6.8 | $1.323 | 0/1 | 233.9s |
| #109 | Grok 4.5 low | X AI | 5.0 | 7.8 | $1.345 | 0/1 | 61.5s |
| #190 | Step 3.7 Flash high | Stepfun | 5.4 | 6.6 | $1.350 | 0/1 | 130.4s |
| #6 | GPT-6.1 Sol xhigh | OpenAI | 10.0 | 9.9 | $1.377 | 1/1 | 58.9s |
| #176 | Grok Build 0.1 medium | X AI | 3.4 | 6.7 | $1.419 | 0/1 | 69.0s |
| #66 | Claude Sonnet 5 medium | Anthropic | 10.0 | 8.5 | $1.438 | 1/1 | 69.3s |
| #121 | Seed-2.0-Code high | Bytedance Seed | 10.0 | 7.5 | $1.448 | 1/1 | 139.9s |