Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Pruebas correctas ↓.

Modelos mostrados

Fallos totales

1558

Modelo más afectado

Gemini 3 Flash Preview 1

Categorías

En la categoría Específico del dominio412 En la categoría Trucos anti-IA293 En la categoría Programación252 En la categoría Resolución de acertijos201 En la categoría Cultura general168 En la categoría Combinado68 En la categoría Seguimiento de instrucciones61 En la categoría Inteligencia general59 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

209/209

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#28	Inkling high	Thinkingmachines	4	8.0	$1.006	15/22	64.2s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $1.006 Tiempo de respuesta (promedio) 64.2s
#32	Inkling medium	Thinkingmachines	4	8.0	$0.391	15/22	16.2s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.391 Tiempo de respuesta (promedio) 16.2s
#36	Qwen3.7 Plus medium	Qwen	5	7.9	$0.267	15/22	51.5s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.267 Tiempo de respuesta (promedio) 51.5s
#37	Qwen3.6 Plus medium	Qwen	5	7.8	$0.405	15/22	43.1s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.405 Tiempo de respuesta (promedio) 43.1s
#44	GPT-5.6 Luna high	OpenAI	7	7.7	$1.017	15/22	18.7s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $1.017 Tiempo de respuesta (promedio) 18.7s
#59	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.197 Tiempo de respuesta (promedio) 4.52s
#79	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $1.079 Tiempo de respuesta (promedio) 9.93s
#49	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.323 Tiempo de respuesta (promedio) 23.0s
#100	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.018 Tiempo de respuesta (promedio) 16.3s
#133	Gemini 3 PRO Preview medium	Google	3	6.0	$0.385	14/21	9.05s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.385 Tiempo de respuesta (promedio) 9.05s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.951 Tiempo de respuesta (promedio) 22.6s
#29	Step 3.7 Flash medium	Stepfun	5	8.0	$0.515	14/22	26.4s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.515 Tiempo de respuesta (promedio) 26.4s
#30	GPT-5.2 Chat none	OpenAI	6	8.0	$0.604	14/22	7.65s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.604 Tiempo de respuesta (promedio) 7.65s
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.970 Tiempo de respuesta (promedio) 62.7s
#34	GPT-5.6 Terra high	OpenAI	7	8.0	$1.055	14/22	11.3s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $1.055 Tiempo de respuesta (promedio) 11.3s

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)