AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Fallos AI BENCHY

Fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir.

Modelos mostrados

15

Fallos totales

572

Modelo más afectado

GPT-4o-mini 13
Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación Pruebas correctas Tiempo de respuesta (promedio)
#75 GLM 5.1 none Z.ai 10 5.6 5/18 4.33s
#77 GLM 5 Turbo none Z.ai 10 5.5 6/18 2.94s
#79 Grok 4.20 Beta none X AI 10 5.3 4/18 1.19s
#86 GPT-5.4 Mini none OpenAI 10 5.1 5/18 1.17s
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#90 Qwen3.5-9B none Qwen 10 4.8 4/18 1.47s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 9 6.8 9/18 2.60s
#53 GLM 5 none Z.ai 9 6.6 9/18 4.23s
#59 Qwen3.5-Flash none Qwen 9 6.2 8/18 3.25s
#63 Qwen3.5-35B-A3B none Qwen 9 6.1 7/18 3.82s
#65 MiMo-V2-Pro none Xiaomi 9 6.0 7/18 2.39s
#72 Hunter Alpha none OpenRouter 9 5.7 6/18 4.58s
#81 Elephant medium Openrouter 9 5.2 5/18 1.27s
#82 Grok 4.20 none X AI 9 5.2 5/18 1.11s
#85 Elephant none Openrouter 9 5.2 5/18 1.23s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)