Ranking de Chamada de ferramentas
Veja quais modelos de IA vão melhor em Chamada de ferramentas, quais permanecem confiáveis e onde aparecem as maiores diferenças. Ordenar por: Métrica ↑.
216/216
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Pontuação de Chamada de ferramentas | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #33 | Step 3.7 Flash medium | Stepfun | 10.0 | 8.0 | $0.515 | 1/1 | 4.16s |
| #34 | GPT-5.2 Chat none | OpenAI | 10.0 | 8.0 | $0.604 | 1/1 | 4.68s |
| #35 | GLM 5.2 high | Z.ai | 10.0 | 8.0 | $0.817 | 1/1 | 9.25s |
| #38 | GPT-5.6 Terra high | OpenAI | 10.0 | 8.0 | $1.055 | 1/1 | 4.97s |
| #39 | Seed-2.0-Lite medium | Bytedance Seed | 10.0 | 7.9 | $0.234 | 1/1 | 12.4s |
| #40 | Qwen3.7 Plus medium | Qwen | 10.0 | 7.9 | $0.267 | 1/1 | 15.0s |
| #41 | Qwen3.6 Plus medium | Qwen | 10.0 | 7.8 | $0.405 | 1/1 | 5.87s |
| #42 | GLM 5.2 medium | Z.ai | 10.0 | 7.8 | $0.187 | 1/1 | 20.4s |
| #43 | GPT-5.6 Terra medium | OpenAI | 10.0 | 7.8 | $0.676 | 1/1 | 5.09s |
| #44 | Claude Sonnet 4.6 medium | Anthropic | 10.0 | 7.8 | $2.057 | 1/1 | 7.48s |
| #45 | Claude Opus 4.8 low | Anthropic | 10.0 | 7.8 | $2.077 | 1/1 | 6.85s |
| #46 | GLM 5 medium | Z.ai | 10.0 | 7.7 | $0.307 | 1/1 | 15.9s |
| #47 | Claude Opus 4.6 medium | Anthropic | 10.0 | 7.7 | $3.059 | 1/1 | 9.73s |
| #48 | GPT-5.6 Luna high | OpenAI | 10.0 | 7.7 | $1.017 | 1/1 | 4.98s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 10.0 | 7.7 | $0.041 | 1/1 | 74.7s |