Combinado: Chamada de ferramenta inválida
Combinado
Chamada de ferramenta inválida
Veja quais modelos de IA têm mais chance de encontrar Chamada de ferramenta inválida em Combinado, para identificar pontos fracos mais rápido.
Motivos de falha
Categorias
77/77
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Chamada de ferramenta inválida | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #58 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $1.627 | 1/2 | 595.2s |
| #64 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.2 | $0.115 | 1/2 | 16.6s | |
| #65 | Gemini 3.1 Flash Lite medium | 1 | 7.2 | $0.117 | 1/2 | 18.5s | |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 1/2 | 66.2s |
| #68 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.036 | 1/2 | 458.6s |
| #69 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.3 | $0.482 | 1/2 | 106.7s |
| #72 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.046 | 1/2 | 313.5s |
| #75 | Grok 4.20 medium | X AI | 1 | 8.7 | $0.777 | 1/2 | 42.2s |
| #76 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.3 | $0.078 | 1/2 | 79.9s |
| #77 | Kimi K2.5 medium | Moonshot AI | 1 | 6.7 | $0.600 | 1/2 | 89.2s |
| #78 | Mercury 2 medium | Inception | 1 | 6.7 | $0.093 | 1/2 | 7.84s |
| #82 | DeepSeek V4 Pro none | DeepSeek | 1 | 7.9 | $0.096 | 1/2 | 71.6s |
| #84 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 6.9 | $0.187 | 1/2 | 125.4s |
| #85 | Qwen3.6 Flash medium | Qwen | 1 | 6.5 | $0.738 | 1/2 | 299.2s |
| #86 | Step 3.7 Flash high | Stepfun | 1 | 8.7 | $1.207 | 1/2 | 41.2s |