Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Puntuación ↓.

Modelos mostrados

Fallos totales

1585

Modelo más afectado

Gemini 3.6 Flash 1

Categorías

En la categoría Específico del dominio421 En la categoría Trucos anti-IA293 En la categoría Programación259 En la categoría Resolución de acertijos204 En la categoría Cultura general172 En la categoría Combinado69 En la categoría Inteligencia general62 En la categoría Seguimiento de instrucciones61 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

215/215

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#152	Owl Alpha medium	Openrouter	10	5.6	$0.000	8/21	11.9s
Pruebas totales 21 Pruebas incorrectas 13 Costo total $0.000 Tiempo de respuesta (promedio) 11.9s
#153	Mimo V2 PRO none	Xiaomi	11	5.6	$0.045	7/21	2.27s
Pruebas totales 21 Pruebas incorrectas 14 Costo total $0.045 Tiempo de respuesta (promedio) 2.27s
#154	Owl Alpha none	Openrouter	10	5.6	$0.000	7/21	9.88s
Pruebas totales 21 Pruebas incorrectas 14 Costo total $0.000 Tiempo de respuesta (promedio) 9.88s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	11	5.6	$0.048	8/22	8.42s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.048 Tiempo de respuesta (promedio) 8.42s
#156	DeepSeek V4 Flash none	DeepSeek	12	5.6	$0.042	5/22	36.8s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.042 Tiempo de respuesta (promedio) 36.8s
#157	GLM 5.1 none	Z.ai	13	5.5	$0.164	7/22	6.70s
Pruebas totales 22 Pruebas incorrectas 15 Costo total $0.164 Tiempo de respuesta (promedio) 6.70s
#158	Qwen3.6 27B none	Qwen	11	5.5	$0.087	7/22	10.7s
Pruebas totales 22 Pruebas incorrectas 15 Costo total $0.087 Tiempo de respuesta (promedio) 10.7s
#159	Hy3 preview low	Tencent	4	5.5	$0.015	10/21	24.6s
Pruebas totales 21 Pruebas incorrectas 11 Costo total $0.015 Tiempo de respuesta (promedio) 24.6s
#160	MiMo-V2.5-Pro none	Xiaomi	11	5.5	$0.068	6/22	4.12s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.068 Tiempo de respuesta (promedio) 4.12s
#161	Kimi K2.5 none	Moonshot AI	15	5.5	$0.127	6/22	19.2s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.127 Tiempo de respuesta (promedio) 19.2s
#162	Gemma 4 26B A4B none	Google	10	5.5	$0.015	8/22	7.64s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.015 Tiempo de respuesta (promedio) 7.64s
#163	Mimo V2 Omni none	Xiaomi	10	5.5	$0.021	8/21	2.44s
Pruebas totales 21 Pruebas incorrectas 13 Costo total $0.021 Tiempo de respuesta (promedio) 2.44s
#164	KAT-Coder-Air V2.5 low	Kwaipilot	7	5.4	$0.041	7/22	10.1s
Pruebas totales 22 Pruebas incorrectas 15 Costo total $0.041 Tiempo de respuesta (promedio) 10.1s
#165	GPT-5.6 Luna none	OpenAI	14	5.4	$0.142	6/22	1.50s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.142 Tiempo de respuesta (promedio) 1.50s
#166	Laguna XS 2.1 none	Poolside	14	5.3	$0.008	5/22	1.55s
Pruebas totales 22 Pruebas incorrectas 17 Costo total $0.008 Tiempo de respuesta (promedio) 1.55s

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)