Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Pruebas correctas ↓.

Modelos mostrados

Fallos totales

1558

Modelo más afectado

Gemini 3 Flash Preview 1

Categorías

En la categoría Específico del dominio412 En la categoría Trucos anti-IA293 En la categoría Programación252 En la categoría Resolución de acertijos201 En la categoría Cultura general168 En la categoría Combinado68 En la categoría Seguimiento de instrucciones61 En la categoría Inteligencia general59 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

209/209

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#131	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
Pruebas totales 18 Pruebas incorrectas 4 Costo total $0.750 Tiempo de respuesta (promedio) 9.75s
#12	Grok 4.5 high	X AI	2	8.9	$1.707	17/22	76.5s
Pruebas totales 22 Pruebas incorrectas 5 Costo total $1.707 Tiempo de respuesta (promedio) 76.5s
#17	Claude Fable 5 medium	Anthropic	2	8.6	$3.478	17/22	17.2s
Pruebas totales 22 Pruebas incorrectas 5 Costo total $3.478 Tiempo de respuesta (promedio) 17.2s
#13	GPT-5.3-Codex medium	OpenAI	4	8.9	$0.920	16/22	17.0s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.920 Tiempo de respuesta (promedio) 17.0s
#19	Qwen3.6 Max Preview medium	Qwen	5	8.4	$1.143	16/22	67.5s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $1.143 Tiempo de respuesta (promedio) 67.5s
#20	Grok 4.5 low	X AI	6	8.4	$0.935	16/22	15.6s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.935 Tiempo de respuesta (promedio) 15.6s
#22	Grok 4.5 medium	X AI	6	8.3	$1.928	16/22	61.7s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $1.928 Tiempo de respuesta (promedio) 61.7s
#23	Claude Sonnet 5 medium	Anthropic	4	8.3	$0.922	16/22	12.5s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.922 Tiempo de respuesta (promedio) 12.5s
#41	Claude Opus 4.8 low	Anthropic	4	7.8	$2.077	16/22	12.7s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $2.077 Tiempo de respuesta (promedio) 12.7s
#61	Gemini 3 Flash Preview low	Google	6	7.4	$0.177	16/22	6.28s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.177 Tiempo de respuesta (promedio) 6.28s
#38	GLM 5.2 medium	Z.ai	3	7.8	$0.222	15/21	23.3s
Pruebas totales 21 Pruebas incorrectas 6 Costo total $0.222 Tiempo de respuesta (promedio) 23.3s
#42	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
Pruebas totales 21 Pruebas incorrectas 6 Costo total $0.307 Tiempo de respuesta (promedio) 33.5s
#16	Muse Spark 1.1 medium	Meta	4	8.6	$1.357	15/22	25.0s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $1.357 Tiempo de respuesta (promedio) 25.0s
#18	GPT-5.4 medium	OpenAI	5	8.5	$1.533	15/22	23.1s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $1.533 Tiempo de respuesta (promedio) 23.1s
#25	Gemini 2.5 Flash medium	Google	6	8.2	$0.643	15/22	21.2s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.643 Tiempo de respuesta (promedio) 21.2s

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)