Ranking de fallos por No siguió las instrucciones

Mira qué modelos de IA se encuentran con No siguió las instrucciones con más frecuencia para detectar riesgos de fiabilidad antes de elegir.

Modelos mostrados

Fallos totales

246

Modelo más afectado

MiniMax M2.7 5

Categorías

En la categoría Resolución de acertijos90 En la categoría Inteligencia general78 En la categoría Trucos anti-IA33 En la categoría Seguimiento de instrucciones19 En la categoría Programación16 En la categoría Llamada de herramientas8 En la categoría Combinado1 En la categoría Específico del dominio1

141/141

Rango	Modelo	Empresa	Cantidad de No siguió las instrucciones	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#214	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	2	3.2	$0.000	2/19	728ms
Pruebas totales 19 Pruebas incorrectas 17 Costo total $0.000 Tiempo de respuesta (promedio) 728ms
#12	Gemini 3.5 Flash medium	Google	1	9.1	$0.642	19/22	8.20s
Pruebas totales 22 Pruebas incorrectas 3 Costo total $0.642 Tiempo de respuesta (promedio) 8.20s
#15	Grok 4.5 high	X AI	1	8.9	$1.707	17/22	76.5s
Pruebas totales 22 Pruebas incorrectas 5 Costo total $1.707 Tiempo de respuesta (promedio) 76.5s
#26	Claude Sonnet 5 medium	Anthropic	1	8.3	$0.922	16/22	12.5s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.922 Tiempo de respuesta (promedio) 12.5s
#28	Gemini 2.5 Flash medium	Google	1	8.2	$0.643	15/22	21.2s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.643 Tiempo de respuesta (promedio) 21.2s
#31	Gemini 3.5 Flash-Lite high	Google	1	8.1	$0.584	14/22	9.48s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.584 Tiempo de respuesta (promedio) 9.48s
#32	Inkling high	Thinkingmachines	1	8.0	$1.006	15/22	64.2s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $1.006 Tiempo de respuesta (promedio) 64.2s
#33	Step 3.7 Flash medium	Stepfun	1	8.0	$0.515	14/22	26.4s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.515 Tiempo de respuesta (promedio) 26.4s
#34	GPT-5.2 Chat none	OpenAI	1	8.0	$0.604	14/22	7.65s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.604 Tiempo de respuesta (promedio) 7.65s
#35	GLM 5.2 high	Z.ai	1	8.0	$0.817	14/22	62.7s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.817 Tiempo de respuesta (promedio) 62.7s
#41	Qwen3.6 Plus medium	Qwen	1	7.8	$0.405	15/22	43.1s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.405 Tiempo de respuesta (promedio) 43.1s
#46	GLM 5 medium	Z.ai	1	7.7	$0.307	15/21	33.5s
Pruebas totales 21 Pruebas incorrectas 6 Costo total $0.307 Tiempo de respuesta (promedio) 33.5s
#47	Claude Opus 4.6 medium	Anthropic	1	7.7	$3.059	13/22	34.3s
Pruebas totales 22 Pruebas incorrectas 9 Costo total $3.059 Tiempo de respuesta (promedio) 34.3s
#53	GLM 5 Turbo medium	Z.ai	1	7.6	$0.323	14/21	23.0s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.323 Tiempo de respuesta (promedio) 23.0s
#56	Kimi K2.7 Code medium	Moonshot AI	1	7.5	$0.740	12/22	84.2s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.740 Tiempo de respuesta (promedio) 84.2s

Fallos por No siguió las instrucciones

Filtrar modelos

Mejores modelos por Cantidad de No siguió las instrucciones

Cantidad de No siguió las instrucciones vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)