Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Tiempo de respuesta (promedio) ↓.

Modelos mostrados

Fallos totales

1585

Modelo más afectado

Step 3.5 Flash 4

Categorías

En la categoría Específico del dominio421 En la categoría Trucos anti-IA293 En la categoría Programación259 En la categoría Resolución de acertijos204 En la categoría Cultura general172 En la categoría Combinado69 En la categoría Inteligencia general62 En la categoría Seguimiento de instrucciones61 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

215/215

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#31	Gemini 3.5 Flash-Lite high	Google	6	8.1	$0.584	14/22	9.48s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.584 Tiempo de respuesta (promedio) 9.48s
#101	GLM 5.2 none	Z.ai	8	6.6	$0.128	12/22	9.34s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.128 Tiempo de respuesta (promedio) 9.34s
#182	GLM 4.7 Flash none	Z.ai	13	4.9	$0.016	6/22	9.15s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.016 Tiempo de respuesta (promedio) 9.15s
#172	Qwen3 Coder Next none	Qwen	14	5.1	$0.025	5/22	9.12s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.025 Tiempo de respuesta (promedio) 9.12s
#139	Gemini 3 PRO Preview medium	Google	3	6.0	$0.385	14/21	9.05s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.385 Tiempo de respuesta (promedio) 9.05s
#5	GPT-5.6 Sol low	OpenAI	4	9.5	$0.971	18/22	8.79s
Pruebas totales 22 Pruebas incorrectas 4 Costo total $0.971 Tiempo de respuesta (promedio) 8.79s
#168	Ling-2.6-1T none	Inclusionai	12	5.3	$0.016	4/22	8.58s
Pruebas totales 22 Pruebas incorrectas 18 Costo total $0.016 Tiempo de respuesta (promedio) 8.58s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	11	5.6	$0.048	8/22	8.42s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.048 Tiempo de respuesta (promedio) 8.42s
#12	Gemini 3.5 Flash medium	Google	2	9.1	$0.642	19/22	8.20s
Pruebas totales 22 Pruebas incorrectas 3 Costo total $0.642 Tiempo de respuesta (promedio) 8.20s
#67	Claude Sonnet 4.6 none	Anthropic	5	7.3	$0.661	12/22	8.12s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.661 Tiempo de respuesta (promedio) 8.12s
#103	Qwen3.6 Max Preview none	Qwen	10	6.6	$0.231	12/22	7.82s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.231 Tiempo de respuesta (promedio) 7.82s
#34	GPT-5.2 Chat none	OpenAI	6	8.0	$0.604	14/22	7.65s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.604 Tiempo de respuesta (promedio) 7.65s
#162	Gemma 4 26B A4B none	Google	10	5.5	$0.015	8/22	7.64s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.015 Tiempo de respuesta (promedio) 7.64s
#18	Claude Opus 4.7 medium	Anthropic	3	8.7	$1.477	18/22	7.61s
Pruebas totales 22 Pruebas incorrectas 4 Costo total $1.477 Tiempo de respuesta (promedio) 7.61s
#54	GPT-5.6 Luna medium	OpenAI	8	7.6	$0.352	14/22	7.28s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.352 Tiempo de respuesta (promedio) 7.28s

←

1 9 10 11 15

→

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)