AI BENCHY
Advertise here

Fallos por categoría de AI BENCHY

Llamada de herramientas: No siguió las instrucciones

Llamada de herramientas
No siguió las instrucciones

Mira qué modelos de IA tienen más probabilidades de caer en No siguió las instrucciones dentro de Llamada de herramientas, para detectar puntos débiles más rápido. Ordenar por: Cantidad de fallos ↑.

Modelos mostrados

6

Fallos totales

6

Modelo más afectado

Grok 4.20 Beta 1
Rango Modelo Empresa Cantidad de No siguió las instrucciones Puntuación de categoría Pruebas correctas Tiempo de respuesta (promedio)
#13 Grok 4.20 Beta medium X AI 1 3.0 0/1 12.4s
#45 GPT-5.4 Mini medium OpenAI 1 4.7 0/1 9.62s
#65 Grok 4.20 medium X AI 1 3.0 0/1 13.7s
#130 MiniMax M2.7 medium Minimax 1 4.7 0/1 12.0s
#141 Nemotron 3 Super none NVIDIA 1 4.7 0/1 16.0s
#144 GPT-5.4 Mini none OpenAI 1 3.0 0/1 2.32s

Mejores modelos por Cantidad de No siguió las instrucciones

Cantidad de No siguió las instrucciones vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)

Mejores modelos por Costo desperdiciado estimado