Combinado: Chamada de ferramenta inválida
Combinado
Chamada de ferramenta inválida
Veja quais modelos de IA têm mais chance de encontrar Chamada de ferramenta inválida em Combinado, para identificar pontos fracos mais rápido.
Motivos de falha
Categorias
125/125
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Chamada de ferramenta inválida | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #258 | North Mini Code none | Cohere | 2 | 3.2 | $0.000 | 0/2 | 96.2s |
| #262 | DeepSeek V3.2 none | DeepSeek | 2 | 4.8 | $0.054 | 0/2 | 113.5s |
| #266 | Ling-2.6-flash none | Inclusionai | 2 | 3.0 | $0.002 | 0/2 | 35.7s |
| #272 | Trinity Large Thinking high | Arcee AI | 2 | 3.0 | $0.592 | 0/2 | 262.4s |
| #275 | GLM 4.7 Flash none | Z.ai | 2 | 3.0 | $0.016 | 0/2 | 50.2s |
| #289 | GLM 4.7 Flash medium | Z.ai | 2 | 2.9 | $0.168 | 0/2 | 802.8s |
| #298 | Granite 4.1 8B none | IBM Granite | 2 | 3.0 | $0.007 | 0/2 | 9.28s |
| #7 | Gemini 3.5 Flash high | 1 | 8.2 | $2.011 | 1/2 | 84.1s | |
| #17 | Gemini 3.8 Flash medium | 1 | 8.7 | $0.653 | 1/2 | 60.3s | |
| #19 | Qwen3.7 Max medium | Qwen | 1 | 8.7 | $1.157 | 1/2 | 287.8s |
| #23 | Qwen3.8 Max medium | Qwen | 1 | 8.7 | $0.771 | 1/2 | 91.3s |
| #28 | Gemini 3.5 Flash low | 1 | 8.2 | $0.449 | 1/2 | 30.0s | |
| #29 | Muse Spark 1.3 medium | Meta | 1 | 7.3 | $1.469 | 1/2 | 34.7s |
| #34 | GLM 5.3 Flash max | Z.ai | 1 | 7.3 | $0.059 | 1/2 | 138.7s |
| #36 | Muse Spark 1.2 high | Meta | 1 | 8.0 | $1.771 | 1/2 | 39.9s |