AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Fallos por categoría de AI BENCHY

Cultura general: Respuesta incorrecta

Cultura general
Respuesta incorrecta

Mira qué modelos de IA tienen más probabilidades de caer en Respuesta incorrecta dentro de Cultura general, para detectar puntos débiles más rápido.

Modelos mostrados

15

Fallos totales

117

Modelo más afectado

Claude Opus 4.7 1

Motivos de fallo

Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación de categoría Pruebas correctas Tiempo de respuesta (promedio)
#40 Gemini 3.1 Flash Lite Preview none Google 1 3.0 0/1 814ms
#41 GPT-5.2 Chat none OpenAI 1 3.0 0/1 6.89s
#42 Kimi K2.6 medium Moonshot AI 1 3.0 0/1 130.3s
#43 Step 3.5 Flash medium Stepfun 1 3.0 0/1 108.4s
#44 Gemini 3.1 Flash Lite low Google 1 3.0 0/1 1.46s
#45 Qwen3.5-Flash medium Qwen 1 3.0 0/1 49.0s
#46 GPT-5.3 Chat none OpenAI 1 3.0 0/1 4.38s
#47 GLM 5.1 medium Z.ai 1 3.0 0/1 29.4s
#48 DeepSeek V4 Flash high DeepSeek 1 3.0 0/1 54.5s
#49 GLM 5V Turbo medium Z.ai 1 3.0 0/1 41.0s
#50 Qwen3.6 Flash medium Qwen 1 3.0 0/1 122.9s
#52 Claude Opus 4.6 medium Anthropic 1 3.0 0/1 63.2s
#53 GPT-5.4 Nano medium OpenAI 1 3.0 0/1 4.81s
#54 Qwen3.6 Max Preview none Qwen 1 3.0 0/1 1.97s
#55 MiMo-V2-Flash medium Xiaomi 1 3.0 0/1 1.96s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)

Mejores modelos por Costo desperdiciado estimado