AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Fallos por categoría de AI BENCHY

Seguimiento de instrucciones: No siguió las instrucciones

Seguimiento de instrucciones
No siguió las instrucciones

Mira qué modelos de IA tienen más probabilidades de caer en No siguió las instrucciones dentro de Seguimiento de instrucciones, para detectar puntos débiles más rápido. Ordenar por: Tiempo de respuesta (promedio) ↑.

Modelos mostrados

15

Fallos totales

23

Modelo más afectado

Grok 4.20 1
Rango Modelo Empresa Cantidad de No siguió las instrucciones Puntuación de categoría Pruebas correctas Tiempo de respuesta (promedio)
#96 Grok 4.20 none X AI 1 4.8 0/2 455ms
#93 Grok 4.20 Beta none X AI 1 4.8 0/2 687ms
#113 GPT-5.4 Nano none OpenAI 1 5.0 0/2 787ms
#71 Gemma 4 26B A4B none Google 1 4.4 0/2 1.08s
#91 Trinity Large Preview none Arcee AI 1 4.1 0/2 1.09s
#104 GPT-4o-mini none OpenAI 1 4.8 0/2 1.27s
#103 Nemotron 3 Super none NVIDIA 1 4.9 0/2 1.50s
#87 GLM 5.1 none Z.ai 1 8.3 1/2 1.58s
#52 GPT-5.4 Mini medium OpenAI 1 7.4 1/2 2.50s
#67 Grok 4.20 Multi Agent Beta medium X AI 1 8.3 1/2 4.63s
#83 MiniMax M2.5 medium Minimax 1 8.1 1/2 4.64s
#43 MiMo-V2-Omni medium Xiaomi 1 8.3 1/2 4.92s
#31 Grok 4.20 Beta medium X AI 1 8.3 1/2 4.97s
#36 Step 3.5 Flash medium Stepfun 1 8.5 1/2 4.98s
#98 gpt-oss-120b none OpenAI 1 8.4 1/2 5.10s

Mejores modelos por Cantidad de No siguió las instrucciones

Cantidad de No siguió las instrucciones vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)

Mejores modelos por Costo desperdiciado estimado