Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Puntuación ↑.

Modelos mostrados

Fallos totales

1585

Modelo más afectado

LFM2-24B-A2B 9

Categorías

En la categoría Específico del dominio421 En la categoría Trucos anti-IA293 En la categoría Programación259 En la categoría Resolución de acertijos204 En la categoría Cultura general172 En la categoría Combinado69 En la categoría Inteligencia general62 En la categoría Seguimiento de instrucciones61 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

215/215

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#186	GPT-5.4 Nano none	OpenAI	15	4.8	$0.041	4/22	2.57s
Pruebas totales 22 Pruebas incorrectas 18 Costo total $0.041 Tiempo de respuesta (promedio) 2.57s
#185	Ring-2.6-1T none	Inclusionai	5	4.8	$0.026	9/22	55.1s
Pruebas totales 22 Pruebas incorrectas 13 Costo total $0.026 Tiempo de respuesta (promedio) 55.1s
#184	Ling-2.6-flash none	Inclusionai	9	4.9	$0.002	6/22	10.7s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.002 Tiempo de respuesta (promedio) 10.7s
#183	Nemotron 3 Super none	NVIDIA	15	4.9	$0.008	5/22	5.97s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.008 Tiempo de respuesta (promedio) 5.97s
#182	GLM 4.7 Flash none	Z.ai	13	4.9	$0.016	6/22	9.15s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.016 Tiempo de respuesta (promedio) 9.15s
#181	Qwen3.6 Plus Preview medium	Qwen	2	4.9	$0.000	9/19	15.2s
Pruebas totales 19 Pruebas incorrectas 10 Costo total $0.000 Tiempo de respuesta (promedio) 15.2s
#180	GPT-4o-mini none	OpenAI	15	5.0	$0.010	5/22	1.99s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.010 Tiempo de respuesta (promedio) 1.99s
#179	DeepSeek V3.2 none	DeepSeek	7	5.0	$0.054	6/22	18.3s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.054 Tiempo de respuesta (promedio) 18.3s
#178	MiniMax M2.7 medium	Minimax	6	5.0	$0.163	5/22	41.3s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.163 Tiempo de respuesta (promedio) 41.3s
#177	North Mini Code none	Cohere	12	5.1	$0.000	4/22	29.9s
Pruebas totales 22 Pruebas incorrectas 18 Costo total $0.000 Tiempo de respuesta (promedio) 29.9s
#176	GLM 5 Turbo none	Z.ai	13	5.1	$0.047	6/21	2.82s
Pruebas totales 21 Pruebas incorrectas 15 Costo total $0.047 Tiempo de respuesta (promedio) 2.82s
#175	Qwen3.5-9B none	Qwen	14	5.1	$0.021	4/22	19.2s
Pruebas totales 22 Pruebas incorrectas 18 Costo total $0.021 Tiempo de respuesta (promedio) 19.2s
#174	MiMo-V2.5 none	Xiaomi	14	5.1	$0.025	5/22	4.62s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.025 Tiempo de respuesta (promedio) 4.62s
#173	Mistral Small 4 medium	Mistral	12	5.1	$0.096	5/22	10.8s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.096 Tiempo de respuesta (promedio) 10.8s
#172	Qwen3 Coder Next none	Qwen	14	5.1	$0.025	5/22	9.12s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.025 Tiempo de respuesta (promedio) 9.12s

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)