Tarefas de agentes: Chamada de ferramenta inválida
Tarefas de agentes
Chamada de ferramenta inválida
Veja quais modelos de IA têm mais chance de encontrar Chamada de ferramenta inválida em Tarefas de agentes, para identificar pontos fracos mais rápido. Ordenar por: Testes corretos ↓.
Motivos de falha
44/44
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Chamada de ferramenta inválida | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #46 | Claude Opus 5 medium | Anthropic | 1 | 7.4 | $2.896 | 0/1 | 87.6s |
| #52 | Gemini 3.7 Flash low | 1 | 6.4 | $0.293 | 0/1 | 62.6s | |
| #61 | Qwen3.8 Max (0902) low | Qwen | 1 | 6.1 | $1.131 | 0/1 | 136.0s |
| #67 | Gemini 3.5 Flash high | 1 | 4.1 | $2.672 | 0/1 | 84.7s | |
| #85 | Claude Sonnet 5.5 high | Anthropic | 1 | 7.4 | $1.197 | 0/1 | 53.6s |
| #87 | Claude Opus 4.7 medium | Anthropic | 1 | 5.2 | $3.636 | 0/1 | 150.6s |
| #89 | Gemini 3.5 Flash medium | 1 | 3.8 | $1.308 | 0/1 | 83.6s | |
| #97 | GLM 5.3 FlashX max | Z.ai | 1 | 6.1 | $0.623 | 0/1 | 104.8s |
| #106 | GPT-6 Luna medium | OpenAI | 1 | 7.4 | $0.048 | 0/1 | 71.7s |
| #110 | GPT-6 Luna high | OpenAI | 1 | 5.2 | $0.074 | 0/1 | 82.8s |
| #121 | GPT-5.4 Mini medium | OpenAI | 1 | 7.4 | $0.965 | 0/1 | 84.3s |
| #122 | GPT-5.6 Luna medium | OpenAI | 1 | 7.4 | $0.101 | 0/1 | 58.1s |
| #130 | Inkling medium | Thinkingmachines | 1 | 4.7 | $0.540 | 0/1 | 45.9s |
| #138 | Gemini 3.5 Flash Lite medium | 1 | 4.7 | $0.440 | 0/1 | 86.9s | |
| #146 | Step 3.7 Flash low | Stepfun | 1 | 7.4 | $0.449 | 0/1 | 83.6s |