Ranking de Chamada de ferramentas
Veja quais modelos de IA vão melhor em Chamada de ferramentas, quais permanecem confiáveis e onde aparecem as maiores diferenças. Ordenar por: Custo total ↓.
Modelos exibidos
15
Média de Pontuação de Chamada de ferramentas
8.8
Melhor modelo
Grok 4.20 Multi Agent Beta 3.0
216/216
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Pontuação de Chamada de ferramentas | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #82 | Mercury 2 medium | Inception | 10.0 | 7.0 | $0.093 | 1/1 | 1.89s |
| #109 | Qwen3.5-27B none | Qwen | 10.0 | 6.5 | $0.090 | 1/1 | 3.54s |
| #100 | Gemma 4 26B A4B medium | 10.0 | 6.6 | $0.089 | 1/1 | 9.01s | |
| #158 | Qwen3.6 27B none | Qwen | 9.5 | 5.5 | $0.087 | 1/1 | 6.74s |
| #197 | Grok 4.20 Beta none | X AI | 10.0 | 4.4 | $0.087 | 1/1 | 4.79s |
| #93 | Gemini 3 Flash Preview none | 10.0 | 6.8 | $0.085 | 1/1 | 3.35s | |
| #107 | MiMo-V2.5 medium | Xiaomi | 10.0 | 6.5 | $0.082 | 1/1 | 7.29s |
| #80 | DeepSeek V3.2 medium | DeepSeek | 10.0 | 7.0 | $0.078 | 1/1 | 34.8s |
| #150 | KAT-Coder-Air V2.5 high | Kwaipilot | 10.0 | 5.6 | $0.077 | 1/1 | 4.77s |
| #131 | Qwen3.5-Flash none | Qwen | 10.0 | 6.1 | $0.073 | 1/1 | 3.67s |
| #113 | Qwen3.5 Plus 2026-02-15 none | Qwen | 10.0 | 6.4 | $0.073 | 1/1 | 3.33s |
| #191 | Grok 4.1 Fast medium | X AI | 2.8 | 4.7 | $0.069 | 0/1 | 27.7s |
| #160 | MiMo-V2.5-Pro none | Xiaomi | 10.0 | 5.5 | $0.068 | 1/1 | 3.30s |
| #108 | Laguna XS 2.1 medium | Poolside | 10.0 | 6.5 | $0.068 | 1/1 | 3.01s |
| #188 | KAT-Coder-Air V2.5 none | Kwaipilot | 10.0 | 4.8 | $0.067 | 1/1 | 5.13s |