AI BENCHY
Advertise here

Categoría AI BENCHY

Ranking de Llamada de herramientas

Mira qué modelos de IA rinden mejor en Llamada de herramientas, cuáles se mantienen fiables y dónde aparecen las mayores diferencias. Ordenar por: Métrica ↑.

Modelos mostrados

15

Promedio de Puntuación de Llamada de herramientas

8.7

Mejor modelo

Grok 4.1 Fast 2.8
Rango Modelo Empresa Puntuación de Llamada de herramientas Puntuación Pruebas correctas Tiempo de respuesta (promedio)
#141 Nemotron 3 Super none NVIDIA 4.7 4.9 0/1 16.0s
#59 GLM 5V Turbo medium Z.ai 7.0 7.2 0/1 12.5s
#118 Qwen3.6 27B none Qwen 9.5 5.6 1/1 6.74s
#2 Gemini 3.5 Flash high Google 9.8 9.6 1/1 4.96s
#99 gpt-oss-120b medium OpenAI 9.8 6.1 1/1 6.91s
#1 Gemini 3 Flash Preview medium Google 10.0 9.8 1/1 12.6s
#3 Gemini 3.5 Flash low Google 10.0 9.4 1/1 3.27s
#4 Gemini 3.1 Pro Preview medium Google 10.0 9.4 1/1 23.1s
#5 Qwen3.7 Max medium Qwen 10.0 9.1 1/1 6.63s
#6 GPT-5.5 low OpenAI 10.0 9.0 1/1 4.96s
#7 Gemini 3.5 Flash medium Google 10.0 9.0 1/1 3.81s
#8 Claude Opus 4.7 none Anthropic 10.0 8.9 1/1 4.74s
#9 GPT-5.5 medium OpenAI 10.0 8.8 1/1 10.6s
#10 Claude Opus 4.8 medium Anthropic 10.0 8.7 1/1 8.96s
#11 Claude Opus 4.7 medium Anthropic 10.0 8.7 1/1 4.17s

Mejores modelos por Puntuación de Llamada de herramientas

Puntuación de Llamada de herramientas vs costo total

Mejores modelos por Tiempo de respuesta (promedio)