AI BENCHY
Advertise here

Fallos AI BENCHY

Fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Pruebas correctas ↓.

Modelos mostrados

15

Fallos totales

1204

Modelo más afectado

Gemini 3 Flash Preview 1
Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación Pruebas correctas Tiempo de respuesta (promedio)
#64 MiMo-V2-Flash medium Xiaomi 5 7.2 12/21 20.1s
#65 Grok 4.20 medium X AI 6 7.1 12/21 27.7s
#68 Claude Opus 4.8 none Anthropic 4 7.0 12/21 3.47s
#69 Claude Opus 4.6 medium Anthropic 3 7.0 12/21 25.9s
#53 Gemini 3.1 Flash Lite high Google 4 7.3 10/18 62.0s
#62 Step 3.5 Flash medium Stepfun 4 7.2 11/20 72.5s
#59 GLM 5V Turbo medium Z.ai 7 7.2 11/21 23.1s
#66 Qwen3.5-35B-A3B medium Qwen 2 7.1 11/21 72.6s
#67 MiniMax M3 medium Minimax 3 7.1 11/21 68.2s
#70 GPT-5.4 Nano medium OpenAI 8 7.0 11/21 12.0s
#71 Step 3.7 Flash high Stepfun 6 7.0 11/21 64.5s
#72 DeepSeek V3.2 medium DeepSeek 5 7.0 11/21 68.7s
#73 Seed-2.0-Mini medium Bytedance Seed 4 6.9 11/21 80.2s
#74 Qwen3.6 Max Preview none Qwen 10 6.9 11/21 3.30s
#75 Ring-2.6-1T medium Inclusionai 6 6.9 11/21 61.3s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)