Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Cantidad de fallos ↑.

Modelos mostrados

Fallos totales

1558

Modelo más afectado

Gemini 3 Flash Preview 1

Categorías

En la categoría Específico del dominio412 En la categoría Trucos anti-IA293 En la categoría Programación252 En la categoría Resolución de acertijos201 En la categoría Cultura general168 En la categoría Combinado68 En la categoría Seguimiento de instrucciones61 En la categoría Inteligencia general59 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

209/209

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#133	Gemini 3 PRO Preview medium	Google	3	6.0	$0.385	14/21	9.05s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.385 Tiempo de respuesta (promedio) 9.05s
#135	Hy3 preview high	Tencent	3	5.9	$0.048	11/21	56.6s
Pruebas totales 21 Pruebas incorrectas 10 Costo total $0.048 Tiempo de respuesta (promedio) 56.6s
#3	GPT-5.6 Sol low	OpenAI	4	9.5	$0.971	18/22	8.79s
Pruebas totales 22 Pruebas incorrectas 4 Costo total $0.971 Tiempo de respuesta (promedio) 8.79s
#4	GPT-5.6 Sol medium	OpenAI	4	9.4	$1.316	18/22	11.4s
Pruebas totales 22 Pruebas incorrectas 4 Costo total $1.316 Tiempo de respuesta (promedio) 11.4s
#5	GPT-5.6 Sol high	OpenAI	4	9.4	$1.234	18/22	11.7s
Pruebas totales 22 Pruebas incorrectas 4 Costo total $1.234 Tiempo de respuesta (promedio) 11.7s
#10	GPT-5.5 medium	OpenAI	4	9.0	$4.137	18/22	38.4s
Pruebas totales 22 Pruebas incorrectas 4 Costo total $4.137 Tiempo de respuesta (promedio) 38.4s
#13	GPT-5.3-Codex medium	OpenAI	4	8.9	$0.920	16/22	17.0s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.920 Tiempo de respuesta (promedio) 17.0s
#16	Muse Spark 1.1 medium	Meta	4	8.6	$1.357	15/22	25.0s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $1.357 Tiempo de respuesta (promedio) 25.0s
#23	Claude Sonnet 5 medium	Anthropic	4	8.3	$0.922	16/22	12.5s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.922 Tiempo de respuesta (promedio) 12.5s
#27	Muse Spark 1.1 high	Meta	4	8.1	$1.694	12/22	31.5s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $1.694 Tiempo de respuesta (promedio) 31.5s
#28	Inkling high	Thinkingmachines	4	8.0	$1.006	15/22	64.2s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $1.006 Tiempo de respuesta (promedio) 64.2s
#32	Inkling medium	Thinkingmachines	4	8.0	$0.391	15/22	16.2s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.391 Tiempo de respuesta (promedio) 16.2s
#40	Claude Sonnet 4.6 medium	Anthropic	4	7.8	$2.057	14/22	25.9s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $2.057 Tiempo de respuesta (promedio) 25.9s
#41	Claude Opus 4.8 low	Anthropic	4	7.8	$2.077	16/22	12.7s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $2.077 Tiempo de respuesta (promedio) 12.7s
#49	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.323 Tiempo de respuesta (promedio) 23.0s

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)