Combinado: Chamada de ferramenta inválida
Combinado
Chamada de ferramenta inválida
Veja quais modelos de IA têm mais chance de encontrar Chamada de ferramenta inválida em Combinado, para identificar pontos fracos mais rápido.
Motivos de falha
Categorias
125/125
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Chamada de ferramenta inválida | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #89 | DeepSeek V4 Flash 0423 high | DeepSeek | 1 | 6.4 | $0.042 | 1/2 | 104.1s |
| #93 | Nemotron 3 Ultra medium | NVIDIA | 1 | 6.3 | $0.701 | 1/2 | 218.2s |
| #94 | Claude Opus 5 none | Anthropic | 1 | 8.3 | $1.550 | 1/2 | 30.5s |
| #96 | GPT-5.6 Terra low | OpenAI | 1 | 8.7 | $0.420 | 1/2 | 9.68s |
| #99 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 6.9 | $0.459 | 1/2 | 175.8s |
| #100 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $0.982 | 1/2 | 595.2s |
| #102 | GPT-5.4 Mini medium | OpenAI | 1 | 6.9 | $0.786 | 1/2 | 59.6s |
| #105 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.2 | $0.117 | 1/2 | 16.6s | |
| #110 | Qwen3.8 2.4T A95B high | Qwen | 1 | 6.9 | $2.357 | 1/2 | 266.1s |
| #116 | GLM 5.3 Flash high | Z.ai | 1 | 6.4 | $0.029 | 1/2 | 91.1s |
| #117 | Gemini 3.1 Flash Lite medium | 1 | 7.2 | $0.120 | 1/2 | 18.5s | |
| #119 | DeepSeek V4 Flash 0731 medium | DeepSeek | 1 | 7.3 | $0.066 | 1/2 | 150.6s |
| #121 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.247 | 1/2 | 458.6s |
| #122 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.3 | $0.506 | 1/2 | 106.7s |
| #127 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.207 | 1/2 | 313.5s |