Ranking de Tarefas de agentes
Veja quais modelos de IA vão melhor em Tarefas de agentes, quais permanecem confiáveis e onde aparecem as maiores diferenças. Ordenar por: Testes corretos ↓.
Modelos exibidos
15
Média de Pontuação de Tarefas de agentes
5.8
Melhor modelo
Gemini 3.6 Flash 10.0
380/380
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Pontuação de Tarefas de agentes | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #330 | Hy3 preview low | Tencent | 0.0 | 4.5 | $0.042 | 0/0 | 0ms |
| #331 | Ring 2.6 1t none | Inclusionai | 3.0 | 4.5 | $0.004 | 0/1 | 19ms |
| #332 | Mimo V2 Omni none | Xiaomi | 0.0 | 4.5 | $0.021 | 0/0 | 0ms |
| #333 | Nemotron 3 Super none | NVIDIA | 2.8 | 4.5 | $0.016 | 0/1 | 30.5s |
| #334 | KAT Coder AIR V2.5 none | Kwaipilot | 3.0 | 4.4 | $0.070 | 0/1 | 1.07s |
| #335 | Trinity Large Preview none | Arcee AI | 3.0 | 4.4 | $0.001 | 0/1 | 88ms |
| #336 | Granite 4.2 8B none | IBM Granite | 5.0 | 4.4 | $0.047 | 0/1 | 49.2s |
| #337 | Cobuddy medium | Baidu | 3.0 | 4.4 | $0.000 | 0/1 | 173ms |
| #338 | Mercury 2 none | Inception | 3.0 | 4.4 | $0.033 | 0/1 | 9.00s |
| #339 | Gemini 3.1 Flash Lite Preview high | 0.0 | 4.3 | $2.310 | 0/0 | 0ms | |
| #340 | MiniMax M2.5 medium | Minimax | 3.0 | 4.3 | $0.359 | 0/1 | 600.8s |
| #341 | GLM 4.7 Flash medium | Z.ai | 3.9 | 4.2 | $0.193 | 0/1 | 399.2s |
| #342 | gpt-oss-120b none | OpenAI | 6.1 | 4.2 | $0.016 | 0/1 | 140.9s |
| #343 | GLM 5 Turbo none | Z.ai | 0.0 | 4.2 | $0.047 | 0/0 | 0ms |
| #344 | Mercury 2.5 none | Inception | 5.0 | 4.1 | $0.026 | 0/1 | 63.4s |