AI BENCHY
Your ad here

Fallos por categoría de AI BENCHY

Combinado: Respuesta incorrecta

Combinado
Respuesta incorrecta

Mira qué modelos de IA tienen más probabilidades de caer en Respuesta incorrecta dentro de Combinado, para detectar puntos débiles más rápido.

Modelos mostrados

15

Fallos totales

37

Modelo más afectado

Gemini 3 Flash Preview 1
Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación de categoría Pruebas correctas Tiempo de respuesta (promedio)
#5 Gemini 3 Flash Preview low Google 1 3.0 0/1 3.27s
#12 Gemini 3 PRO Preview medium Google 1 3.0 0/1 10.4s
#21 Gemini 3 Flash Preview none Google 1 4.7 0/1 3.56s
#22 Gemini 3.1 Flash Lite Preview low Google 1 3.0 0/1 11.9s
#23 MiMo-V2-Pro medium Xiaomi 1 4.7 0/1 64.7s
#29 Gemini 3.1 Flash Lite Preview none Google 1 3.0 0/1 3.20s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 1 3.0 0/1 6.65s
#53 GLM 5 none Z.ai 1 3.0 0/1 4.98s
#55 MiMo-V2-Omni none Xiaomi 1 3.0 0/1 2.47s
#58 GLM 5V Turbo none Z.ai 1 3.0 0/1 6.51s
#59 Qwen3.5-Flash none Qwen 1 3.0 0/1 6.22s
#60 Gemma 4 26B A4B none Google 1 3.0 0/1 30.5s
#61 Seed-2.0-Lite none Bytedance Seed 1 3.0 0/1 6.59s
#62 Gemini 2.5 Flash none Google 1 3.0 0/1 4.39s
#63 Qwen3.5-35B-A3B none Qwen 1 3.0 0/1 47.4s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)

Mejores modelos por Costo desperdiciado estimado