Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Pruebas correctas ↑.

Modelos mostrados

Fallos totales

1585

Modelo más afectado

Granite 4.1 8B 13

Categorías

En la categoría Específico del dominio421 En la categoría Trucos anti-IA293 En la categoría Programación259 En la categoría Resolución de acertijos204 En la categoría Cultura general172 En la categoría Combinado69 En la categoría Inteligencia general62 En la categoría Seguimiento de instrucciones61 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

215/215

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#211	Laguna Xs.2 none	Poolside	8	3.8	$0.004	5/19	806ms
Pruebas totales 19 Pruebas incorrectas 14 Costo total $0.004 Tiempo de respuesta (promedio) 806ms
#142	GPT-5.4 Mini none	OpenAI	13	5.9	$0.095	6/22	1.53s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.095 Tiempo de respuesta (promedio) 1.53s
#148	Qwen3.5-122B-A10B none	Qwen	13	5.7	$0.247	6/22	12.9s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.247 Tiempo de respuesta (promedio) 12.9s
#160	MiMo-V2.5-Pro none	Xiaomi	11	5.5	$0.068	6/22	4.12s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.068 Tiempo de respuesta (promedio) 4.12s
#161	Kimi K2.5 none	Moonshot AI	15	5.5	$0.127	6/22	19.2s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.127 Tiempo de respuesta (promedio) 19.2s
#165	GPT-5.6 Luna none	OpenAI	14	5.4	$0.142	6/22	1.50s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.142 Tiempo de respuesta (promedio) 1.50s
#170	Inkling none	Thinkingmachines	13	5.2	$0.147	6/22	3.50s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.147 Tiempo de respuesta (promedio) 3.50s
#179	DeepSeek V3.2 none	DeepSeek	7	5.0	$0.054	6/22	18.3s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.054 Tiempo de respuesta (promedio) 18.3s
#182	GLM 4.7 Flash none	Z.ai	13	4.9	$0.016	6/22	9.15s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.016 Tiempo de respuesta (promedio) 9.15s
#184	Ling-2.6-flash none	Inclusionai	9	4.9	$0.002	6/22	10.7s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.002 Tiempo de respuesta (promedio) 10.7s
#176	GLM 5 Turbo none	Z.ai	13	5.1	$0.047	6/21	2.82s
Pruebas totales 21 Pruebas incorrectas 15 Costo total $0.047 Tiempo de respuesta (promedio) 2.82s
#201	Elephant Alpha medium	Openrouter	9	4.3	$0.000	6/21	1.27s
Pruebas totales 21 Pruebas incorrectas 15 Costo total $0.000 Tiempo de respuesta (promedio) 1.27s
#204	Laguna Xs.2 medium	Poolside	6	4.1	$0.015	6/19	6.73s
Pruebas totales 19 Pruebas incorrectas 13 Costo total $0.015 Tiempo de respuesta (promedio) 6.73s
#212	gpt-oss-120b none	OpenAI	8	3.7	$0.010	6/19	21.6s
Pruebas totales 19 Pruebas incorrectas 13 Costo total $0.010 Tiempo de respuesta (promedio) 21.6s
#117	LongCat 2.0 none	Meituan	14	6.3	$0.044	7/22	5.18s
Pruebas totales 22 Pruebas incorrectas 15 Costo total $0.044 Tiempo de respuesta (promedio) 5.18s

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)