Ranking de Llamada de herramientas
Mira qué modelos de IA rinden mejor en Llamada de herramientas, cuáles se mantienen fiables y dónde aparecen las mayores diferencias. Ordenar por: Tiempo de respuesta (promedio) ↓.
Modelos mostrados
15
Promedio de Puntuación de Llamada de herramientas
8.8
Mejor modelo
Ring-2.6-1T 10.0
216/216
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Puntuación de Llamada de herramientas | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #202 | Hunter Alpha none | OpenRouter | 10.0 | 4.2 | $0.000 | 1/1 | 6.02s |
| #54 | GPT-5.6 Luna medium | OpenAI | 10.0 | 7.6 | $0.352 | 1/1 | 6.02s |
| #27 | Muse Spark 1.1 low | Meta | 9.8 | 8.3 | $0.647 | 1/1 | 5.98s |
| #97 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10.0 | 6.7 | $0.476 | 1/1 | 5.93s |
| #41 | Qwen3.6 Plus medium | Qwen | 10.0 | 7.8 | $0.405 | 1/1 | 5.87s |
| #181 | Qwen3.6 Plus Preview medium | Qwen | 10.0 | 4.9 | $0.000 | 1/1 | 5.87s |
| #23 | Grok 4.5 low | X AI | 10.0 | 8.4 | $0.935 | 1/1 | 5.83s |
| #15 | Grok 4.5 high | X AI | 10.0 | 8.9 | $1.707 | 1/1 | 5.71s |
| #111 | Gemini 3.1 Flash Lite low | 10.0 | 6.5 | $0.621 | 1/1 | 5.66s | |
| #209 | Grok 4.1 Fast none | X AI | 2.8 | 3.8 | $0.008 | 0/1 | 5.51s |
| #163 | Mimo V2 Omni none | Xiaomi | 10.0 | 5.5 | $0.021 | 1/1 | 5.40s |
| #70 | Claude Opus 4.8 none | Anthropic | 10.0 | 7.3 | $1.166 | 1/1 | 5.35s |
| #103 | Qwen3.6 Max Preview none | Qwen | 10.0 | 6.6 | $0.231 | 1/1 | 5.27s |
| #188 | KAT-Coder-Air V2.5 none | Kwaipilot | 10.0 | 4.8 | $0.067 | 1/1 | 5.13s |
| #43 | GPT-5.6 Terra medium | OpenAI | 10.0 | 7.8 | $0.676 | 1/1 | 5.09s |