Ranking de fallos por No siguió las instrucciones

Mira qué modelos de IA se encuentran con No siguió las instrucciones con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Puntuación ↓.

Modelos mostrados

Fallos totales

246

Modelo más afectado

Gemini 3.5 Flash 1

Categorías

En la categoría Resolución de acertijos90 En la categoría Inteligencia general78 En la categoría Trucos anti-IA33 En la categoría Seguimiento de instrucciones19 En la categoría Programación16 En la categoría Llamada de herramientas8 En la categoría Combinado1 En la categoría Específico del dominio1

141/141

Rango	Modelo	Empresa	Cantidad de No siguió las instrucciones	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#89	Qwen3.6 Flash medium	Qwen	1	6.9	$0.738	12/22	44.7s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.738 Tiempo de respuesta (promedio) 44.7s
#92	Gemini 3.5 Flash minimal	Google	1	6.8	$0.300	14/22	2.65s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.300 Tiempo de respuesta (promedio) 2.65s
#94	Qwen3.6 35B A3B medium	Qwen	1	6.7	$0.746	13/22	58.1s
Pruebas totales 22 Pruebas incorrectas 9 Costo total $0.746 Tiempo de respuesta (promedio) 58.1s
#96	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Pruebas totales 22 Pruebas incorrectas 12 Costo total $0.391 Tiempo de respuesta (promedio) 100.3s
#98	GLM 5V Turbo medium	Z.ai	1	6.7	$0.457	11/21	23.1s
Pruebas totales 21 Pruebas incorrectas 10 Costo total $0.457 Tiempo de respuesta (promedio) 23.1s
#101	GLM 5.2 none	Z.ai	1	6.6	$0.128	12/22	9.34s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.128 Tiempo de respuesta (promedio) 9.34s
#102	LongCat 2.0 high	Meituan	2	6.6	$0.469	9/22	148.7s
Pruebas totales 22 Pruebas incorrectas 13 Costo total $0.469 Tiempo de respuesta (promedio) 148.7s
#105	Qwen3.6 27B medium	Qwen	1	6.5	$0.779	10/22	106.3s
Pruebas totales 22 Pruebas incorrectas 12 Costo total $0.779 Tiempo de respuesta (promedio) 106.3s
#106	Hy3 preview medium	Tencent	1	6.5	$0.018	14/21	16.3s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.018 Tiempo de respuesta (promedio) 16.3s
#107	MiMo-V2.5 medium	Xiaomi	1	6.5	$0.082	12/22	32.2s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.082 Tiempo de respuesta (promedio) 32.2s
#109	Qwen3.5-27B none	Qwen	2	6.5	$0.090	8/22	4.76s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.090 Tiempo de respuesta (promedio) 4.76s
#110	Gemini 3.1 Flash Lite Preview low	Google	1	6.5	$0.646	13/22	16.7s
Pruebas totales 22 Pruebas incorrectas 9 Costo total $0.646 Tiempo de respuesta (promedio) 16.7s
#112	Gemini 3.1 Flash Lite Preview none	Google	2	6.4	$0.052	12/22	1.58s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.052 Tiempo de respuesta (promedio) 1.58s
#114	Ring-2.6-1T medium	Inclusionai	2	6.3	$0.103	11/22	68.7s
Pruebas totales 22 Pruebas incorrectas 11 Costo total $0.103 Tiempo de respuesta (promedio) 68.7s
#115	Mimo V2 PRO medium	Xiaomi	1	6.3	$0.333	12/21	22.2s
Pruebas totales 21 Pruebas incorrectas 9 Costo total $0.333 Tiempo de respuesta (promedio) 22.2s

Fallos por No siguió las instrucciones

Filtrar modelos

Mejores modelos por Cantidad de No siguió las instrucciones

Cantidad de No siguió las instrucciones vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)