AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Fallos AI BENCHY

Fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Tiempo de respuesta (promedio) ↓.

Modelos mostrados

15

Fallos totales

572

Modelo más afectado

Qwen3.5-9B 1
Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación Pruebas correctas Tiempo de respuesta (promedio)
#50 Hunter Alpha medium OpenRouter 4 6.7 8/18 10.3s
#47 Grok 4.20 medium X AI 3 7.0 9/18 10.3s
#87 Qwen3 Coder Next none Qwen 12 5.1 4/18 10.2s
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#56 Grok 4.20 Multi Agent Beta medium X AI 3 6.4 7/18 9.80s
#12 Gemini 3 PRO Preview medium Google 3 8.4 14/18 9.06s
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#28 GPT-5.2 Chat none OpenAI 5 7.9 12/18 6.84s
#60 Gemma 4 26B A4B none Google 7 6.2 7/18 6.59s
#5 Gemini 3 Flash Preview low Google 3 8.8 15/18 6.01s
#36 GPT-5.3 Chat none OpenAI 5 7.7 11/18 5.88s
#73 Mistral Small 4 medium Mistral 8 5.7 5/18 5.64s
#78 Trinity Large Preview none Arcee AI 11 5.3 5/18 5.07s
#42 Claude Sonnet 4.6 none Anthropic 3 7.4 11/18 4.98s
#72 Hunter Alpha none OpenRouter 9 5.7 6/18 4.58s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)