AI BENCHY
Advertise here

Fallos AI BENCHY

Fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Puntuación ↓.

Modelos mostrados

15

Fallos totales

1204

Modelo más afectado

Gemini 3 Flash Preview 1
Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación Pruebas correctas Tiempo de respuesta (promedio)
#46 Qwen3.6 35B A3B medium Qwen 4 7.4 13/21 18.1s
#47 Grok Build 0.1 medium X AI 5 7.4 13/21 49.9s
#48 Gemini 3 Flash Preview none Google 8 7.4 13/21 1.65s
#49 Qwen3.5-Flash medium Qwen 4 7.4 12/21 63.3s
#50 Gemini 3.1 Flash Lite Preview low Google 7 7.4 13/21 2.77s
#51 Mimo V2 PRO medium Xiaomi 5 7.4 12/21 22.2s
#52 Claude Sonnet 4.6 medium Anthropic 4 7.4 13/21 17.1s
#53 Gemini 3.1 Flash Lite high Google 4 7.3 10/18 62.0s
#54 GPT-5 Mini medium OpenAI 5 7.3 12/21 23.6s
#55 GLM 5.1 medium Z.ai 4 7.3 12/21 33.7s
#56 MiMo-V2.5 medium Xiaomi 5 7.3 12/21 27.1s
#57 Step 3.7 Flash low Stepfun 8 7.3 12/21 15.7s
#58 Gemini 3.1 Flash Lite Preview none Google 7 7.2 12/21 1.21s
#59 GLM 5V Turbo medium Z.ai 7 7.2 11/21 23.1s
#60 Kimi K2.6 medium Moonshot AI 3 7.2 12/21 71.7s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)