Combinado: Chamada de ferramenta inválida
Combinado
Chamada de ferramenta inválida
Veja quais modelos de IA têm mais chance de encontrar Chamada de ferramenta inválida em Combinado, para identificar pontos fracos mais rápido. Ordenar por: Tempo de resposta (médio) ↓.
Motivos de falha
Categorias
125/125
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Chamada de ferramenta inválida | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #167 | Qwen3.6 35B A3B medium | Qwen | 1 | 3.0 | $0.672 | 0/2 | 817.6s |
| #294 | GLM 4.7 Flash medium | Z.ai | 2 | 2.9 | $0.168 | 0/2 | 802.8s |
| #245 | Laguna S 2.1 high | Poolside | 2 | 2.9 | $0.114 | 0/2 | 702.3s |
| #100 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $0.982 | 1/2 | 595.2s |
| #170 | Qwen3.6 27B medium | Qwen | 2 | 6.7 | $0.577 | 0/2 | 584.1s |
| #287 | Granite 4.2 8B high | IBM Granite | 1 | 5.0 | $0.084 | 0/2 | 570.4s |
| #216 | North Mini Code medium | Cohere | 1 | 2.9 | $0.000 | 0/2 | 554.9s |
| #188 | Qwen3.5-35B-A3B medium | Qwen | 1 | 3.8 | $0.675 | 0/2 | 512.8s |
| #154 | Gemma 4 26B A4B medium | 1 | 6.3 | $0.092 | 1/2 | 492.9s | |
| #121 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.247 | 1/2 | 458.6s |
| #184 | Gemma 4 31B medium | 1 | 2.9 | $0.100 | 0/2 | 433.1s | |
| #266 | Laguna S 2.1 low | Poolside | 1 | 3.2 | $0.082 | 0/2 | 412.5s |
| #194 | Trinity Large Thinking medium | Arcee AI | 2 | 2.9 | $0.756 | 0/2 | 382.7s |
| #142 | Qwen3.7 Flash medium | Qwen | 1 | 6.4 | $0.065 | 1/2 | 314.2s |
| #127 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.207 | 1/2 | 313.5s |