Ranking de Llamada de herramientas
Mira qué modelos de IA rinden mejor en Llamada de herramientas, cuáles se mantienen fiables y dónde aparecen las mayores diferencias. Ordenar por: Tiempo de respuesta (promedio) ↓.
Modelos mostrados
15
Promedio de Puntuación de Llamada de herramientas
8.8
Mejor modelo
Ring-2.6-1T 10.0
216/216
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Puntuación de Llamada de herramientas | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #113 | Qwen3.5 Plus 2026-02-15 none | Qwen | 10.0 | 6.4 | $0.073 | 1/1 | 3.33s |
| #160 | MiMo-V2.5-Pro none | Xiaomi | 10.0 | 5.5 | $0.068 | 1/1 | 3.30s |
| #14 | Gemini 3.5 Flash low | 10.0 | 8.9 | $0.433 | 1/1 | 3.27s | |
| #71 | Step 3.7 Flash low | Stepfun | 10.0 | 7.3 | $0.454 | 1/1 | 3.25s |
| #138 | GPT-5.6 Terra none | OpenAI | 9.6 | 6.0 | $0.349 | 1/1 | 3.10s |
| #108 | Laguna XS 2.1 medium | Poolside | 10.0 | 6.5 | $0.068 | 1/1 | 3.01s |
| #135 | Nemotron 3 Ultra none | NVIDIA | 10.0 | 6.1 | $0.095 | 1/1 | 2.99s |
| #128 | Gemini 3.1 Flash Lite none | 10.0 | 6.1 | $0.046 | 1/1 | 2.97s | |
| #201 | Elephant Alpha medium | Openrouter | 3.0 | 4.3 | $0.000 | 0/1 | 2.83s |
| #165 | GPT-5.6 Luna none | OpenAI | 10.0 | 5.4 | $0.142 | 1/1 | 2.80s |
| #90 | Step 3.7 Flash high | Stepfun | 10.0 | 6.9 | $1.207 | 1/1 | 2.79s |
| #92 | Gemini 3.5 Flash minimal | 10.0 | 6.8 | $0.300 | 1/1 | 2.79s | |
| #199 | Elephant Alpha none | Openrouter | 3.0 | 4.3 | $0.000 | 0/1 | 2.79s |
| #145 | GPT-5.4 none | OpenAI | 10.0 | 5.8 | $0.397 | 1/1 | 2.75s |
| #193 | Qwen3 Coder Next medium | Qwen | 10.0 | 4.7 | $0.032 | 1/1 | 2.64s |