AI BENCHY
Comparar Gráficos Metodología
❤️ Made by XCS
Your ad here

Fallos por categoría de AI BENCHY

Seguimiento de instrucciones
No siguió las instrucciones

Mira qué modelos de IA tienen más probabilidades de caer en No siguió las instrucciones dentro de Seguimiento de instrucciones, para detectar puntos débiles más rápido. Ordenar por: Tiempo de respuesta (promedio) ↑.

Modelos mostrados

9

Fallos totales

9

Modelo más afectado

Trinity Large Preview 1
Rango Modelo Empresa Cantidad de No siguió las instrucciones Puntuación de categoría Pruebas correctas Tiempo de respuesta (promedio)
#45 Trinity Large Preview none Arcee AI 1 3.5 0/2 1.09s
#47 GPT-4o-mini none OpenAI 1 4.5 0/2 1.27s
#43 MiniMax M2.5 medium Minimax 1 8.0 1/2 4.64s
#13 Step 3.5 Flash medium Stepfun 1 9.0 1/2 4.98s
#30 Grok 4.1 Fast medium X AI 1 5.5 1/2 5.30s
#50 Qwen3 Coder Next medium Qwen 1 4.5 0/2 7.34s
#34 GPT-5 Nano medium OpenAI 1 9.0 1/2 11.9s
#32 GPT-5 Mini medium OpenAI 1 7.5 1/2 15.7s
#8 Gemini 3.1 Flash Lite Preview high Google 1 9.0 1/2 70.1s

Mejores modelos por Cantidad de No siguió las instrucciones

Cantidad de No siguió las instrucciones vs puntuación promedio

Mejores modelos por Tiempo de respuesta (promedio)

Mejores modelos por Costo desperdiciado estimado