Ranking de fallos por No siguió las instrucciones

Mira qué modelos de IA se encuentran con No siguió las instrucciones con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Pruebas correctas ↓.

Modelos mostrados

Fallos totales

246

Modelo más afectado

Gemini 3.5 Flash 1

Categorías

En la categoría Resolución de acertijos90 En la categoría Inteligencia general78 En la categoría Trucos anti-IA33 En la categoría Seguimiento de instrucciones19 En la categoría Programación16 En la categoría Llamada de herramientas8 En la categoría Combinado1 En la categoría Específico del dominio1

141/141

Rango	Modelo	Empresa	Cantidad de No siguió las instrucciones	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#127	gpt-oss-120b medium	OpenAI	3	6.1	$0.019	9/22	21.9s
Pruebas totales 22 Pruebas incorrectas 13 Costo total $0.019 Tiempo de respuesta (promedio) 21.9s
#128	Gemini 3.1 Flash Lite none	Google	1	6.1	$0.046	9/22	1.75s
Pruebas totales 22 Pruebas incorrectas 13 Costo total $0.046 Tiempo de respuesta (promedio) 1.75s
#134	GPT-5 Nano medium	OpenAI	2	6.1	$0.114	9/22	54.9s
Pruebas totales 22 Pruebas incorrectas 13 Costo total $0.114 Tiempo de respuesta (promedio) 54.9s
#185	Ring-2.6-1T none	Inclusionai	2	4.8	$0.026	9/22	55.1s
Pruebas totales 22 Pruebas incorrectas 13 Costo total $0.026 Tiempo de respuesta (promedio) 55.1s
#151	GLM 5V Turbo none	Z.ai	2	5.6	$0.052	8/21	2.99s
Pruebas totales 21 Pruebas incorrectas 13 Costo total $0.052 Tiempo de respuesta (promedio) 2.99s
#152	Owl Alpha medium	Openrouter	2	5.6	$0.000	8/21	11.9s
Pruebas totales 21 Pruebas incorrectas 13 Costo total $0.000 Tiempo de respuesta (promedio) 11.9s
#163	Mimo V2 Omni none	Xiaomi	1	5.5	$0.021	8/21	2.44s
Pruebas totales 21 Pruebas incorrectas 13 Costo total $0.021 Tiempo de respuesta (promedio) 2.44s
#208	Grok Build 0.1 none	X AI	2	4.0	$0.547	7/19	28.7s
Pruebas totales 19 Pruebas incorrectas 12 Costo total $0.547 Tiempo de respuesta (promedio) 28.7s
#109	Qwen3.5-27B none	Qwen	2	6.5	$0.090	8/22	4.76s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.090 Tiempo de respuesta (promedio) 4.76s
#118	Claude Sonnet 5 none	Anthropic	1	6.3	$0.548	8/22	6.04s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.548 Tiempo de respuesta (promedio) 6.04s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	2	6.1	$0.122	8/22	13.6s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.122 Tiempo de respuesta (promedio) 13.6s
#135	Nemotron 3 Ultra none	NVIDIA	1	6.1	$0.095	8/22	3.87s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.095 Tiempo de respuesta (promedio) 3.87s
#138	GPT-5.6 Terra none	OpenAI	1	6.0	$0.349	8/22	1.65s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.349 Tiempo de respuesta (promedio) 1.65s
#146	Nemotron 3 Super medium	NVIDIA	3	5.7	$0.055	8/22	52.0s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.055 Tiempo de respuesta (promedio) 52.0s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	1	5.6	$0.048	8/22	8.42s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.048 Tiempo de respuesta (promedio) 8.42s

Fallos por No siguió las instrucciones

Filtrar modelos

Mejores modelos por Cantidad de No siguió las instrucciones

Cantidad de No siguió las instrucciones vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)