AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Fallos AI BENCHY

Fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir.

Modelos mostrados

15

Fallos totales

572

Modelo más afectado

GPT-4o-mini 13
Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación Pruebas correctas Tiempo de respuesta (promedio)
#36 GPT-5.3 Chat none OpenAI 5 7.7 11/18 5.88s
#48 Gemma 4 31B none Google 5 6.9 10/18 4.02s
#71 MiniMax M2.5 medium Minimax 5 5.7 5/18 39.6s
#80 MiniMax M2.7 medium Minimax 5 5.3 4/18 31.1s
#15 Gemini 2.5 Flash medium Google 4 8.2 13/18 12.1s
#17 Gemini 3.1 Flash Lite Preview medium Google 4 8.2 13/18 3.74s
#22 Gemini 3.1 Flash Lite Preview low Google 4 8.1 13/18 3.22s
#29 Gemini 3.1 Flash Lite Preview none Google 4 7.9 12/18 1.30s
#38 GPT-5.4 Nano medium OpenAI 4 7.6 11/18 11.2s
#44 GPT-5.4 Mini medium OpenAI 4 7.3 9/18 15.2s
#45 GPT-5 Mini medium OpenAI 4 7.0 9/18 24.0s
#46 Kimi K2.5 medium Moonshot AI 4 7.0 9/18 72.4s
#50 Hunter Alpha medium OpenRouter 4 6.7 8/18 10.3s
#5 Gemini 3 Flash Preview low Google 3 8.8 15/18 6.01s
#6 Seed-2.0-Lite medium Bytedance Seed 3 8.6 13/18 30.4s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)