Tarefas de agentes: Chamada de ferramenta inválida
Tarefas de agentes
Chamada de ferramenta inválida
Veja quais modelos de IA têm mais chance de encontrar Chamada de ferramenta inválida em Tarefas de agentes, para identificar pontos fracos mais rápido. Ordenar por: Tempo de resposta (médio) ↓.
Motivos de falha
44/44
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Chamada de ferramenta inválida | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #179 | Grok 4.7 high | X AI | 1 | 3.0 | $3.582 | 0/1 | 322.2s |
| #175 | Grok 4.7 xhigh | X AI | 1 | 3.0 | $4.054 | 0/1 | 304.8s |
| #298 | MiniMax M2.7 medium | Minimax | 1 | 4.7 | $0.202 | 0/1 | 198.8s |
| #226 | Space Bunny Alpha xhigh | Stealth | 1 | 5.2 | $0.000 | 0/1 | 159.1s |
| #346 | Qwen3.5-9B medium | Qwen | 1 | 5.2 | $0.106 | 0/1 | 152.9s |
| #87 | Claude Opus 4.7 medium | Anthropic | 1 | 5.2 | $3.636 | 0/1 | 150.6s |
| #61 | Qwen3.8 Max (0902) low | Qwen | 1 | 6.1 | $1.131 | 0/1 | 136.0s |
| #217 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 7.4 | $0.226 | 0/1 | 133.3s |
| #308 | MiMo-V2.5 none | Xiaomi | 1 | 3.9 | $0.063 | 0/1 | 124.2s |
| #157 | Ember-1 low | Fireworks | 1 | 4.7 | $1.488 | 0/1 | 121.3s |
| #161 | Muse Glimmer 30B low | Meta | 1 | 6.1 | $0.266 | 0/1 | 105.0s |
| #97 | GLM 5.3 FlashX max | Z.ai | 1 | 6.1 | $0.623 | 0/1 | 104.8s |
| #158 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.1 | $1.152 | 0/1 | 95.3s |
| #225 | Gemini 3.5 Flash none | 1 | 3.5 | $1.778 | 0/1 | 89.3s | |
| #164 | Ember-1 high | Fireworks | 1 | 6.1 | $2.405 | 0/1 | 88.3s |