AI BENCHY
Your ad here

Fallos por categoría de AI BENCHY

Resolución de acertijos: Respuesta incorrecta

Resolución de acertijos
Respuesta incorrecta

Mira qué modelos de IA tienen más probabilidades de caer en Respuesta incorrecta dentro de Resolución de acertijos, para detectar puntos débiles más rápido.

Modelos mostrados

15

Fallos totales

85

Modelo más afectado

Kimi K2.5 3
Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación de categoría Pruebas correctas Tiempo de respuesta (promedio)
#46 Kimi K2.5 medium Moonshot AI 1 5.3 1/3 45.4s
#48 Gemma 4 31B none Google 1 5.5 1/3 2.95s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 1 7.7 2/3 2.82s
#50 Hunter Alpha medium OpenRouter 1 6.1 1/3 5.36s
#51 Nemotron 3 Super medium NVIDIA 1 3.5 0/3 8.39s
#52 Grok 4.1 Fast medium X AI 1 5.3 1/3 8.08s
#53 GLM 5 none Z.ai 1 7.7 2/3 2.05s
#54 Mercury 2 medium Inception 1 3.9 0/3 934ms
#57 GPT-5 Nano medium OpenAI 1 5.3 1/3 19.8s
#58 GLM 5V Turbo none Z.ai 1 5.3 1/3 2.22s
#60 Gemma 4 26B A4B none Google 1 5.7 1/3 739ms
#62 Gemini 2.5 Flash none Google 1 5.7 1/3 576ms
#64 DeepSeek V3.2 none DeepSeek 1 8.5 2/3 7.37s
#65 MiMo-V2-Pro none Xiaomi 1 6.0 1/3 1.83s
#66 GPT-5.4 none OpenAI 1 5.6 1/3 1.52s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)

Mejores modelos por Costo desperdiciado estimado