Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Tiempo de respuesta (promedio) ↑.

Modelos mostrados

Fallos totales

1585

Modelo más afectado

Nemotron 3 Nano Omni 30b A3b Reasoning 9

Categorías

En la categoría Específico del dominio421 En la categoría Trucos anti-IA293 En la categoría Programación259 En la categoría Resolución de acertijos204 En la categoría Cultura general172 En la categoría Combinado69 En la categoría Inteligencia general62 En la categoría Seguimiento de instrucciones61 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

215/215

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#148	Qwen3.5-122B-A10B none	Qwen	13	5.7	$0.247	6/22	12.9s
Pruebas totales 22 Pruebas incorrectas 16 Costo total $0.247 Tiempo de respuesta (promedio) 12.9s
#205	Hy3 preview none	Tencent	8	4.0	$0.003	4/21	12.9s
Pruebas totales 21 Pruebas incorrectas 17 Costo total $0.003 Tiempo de respuesta (promedio) 12.9s
#57	GPT-5.4 Nano medium	OpenAI	8	7.5	$0.138	12/22	13.2s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.138 Tiempo de respuesta (promedio) 13.2s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	12	6.1	$0.122	8/22	13.6s
Pruebas totales 22 Pruebas incorrectas 14 Costo total $0.122 Tiempo de respuesta (promedio) 13.6s
#192	Laguna M.1 medium	Poolside	4	4.7	$0.033	9/19	14.7s
Pruebas totales 19 Pruebas incorrectas 10 Costo total $0.033 Tiempo de respuesta (promedio) 14.7s
#2	Gemini 3.6 Flash high	Google	1	9.7	$1.785	21/22	14.9s
Pruebas totales 22 Pruebas incorrectas 1 Costo total $1.785 Tiempo de respuesta (promedio) 14.9s
#4	Gemini 3.5 Flash high	Google	1	9.5	$1.976	20/22	15.1s
Pruebas totales 22 Pruebas incorrectas 2 Costo total $1.976 Tiempo de respuesta (promedio) 15.1s
#181	Qwen3.6 Plus Preview medium	Qwen	2	4.9	$0.000	9/19	15.2s
Pruebas totales 19 Pruebas incorrectas 10 Costo total $0.000 Tiempo de respuesta (promedio) 15.2s
#23	Grok 4.5 low	X AI	6	8.4	$0.935	16/22	15.6s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.935 Tiempo de respuesta (promedio) 15.6s
#150	KAT-Coder-Air V2.5 high	Kwaipilot	9	5.6	$0.077	7/22	15.9s
Pruebas totales 22 Pruebas incorrectas 15 Costo total $0.077 Tiempo de respuesta (promedio) 15.9s
#36	Inkling medium	Thinkingmachines	4	8.0	$0.391	15/22	16.2s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.391 Tiempo de respuesta (promedio) 16.2s
#111	Gemini 3.1 Flash Lite low	Google	9	6.5	$0.621	12/22	16.3s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.621 Tiempo de respuesta (promedio) 16.3s
#106	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.018 Tiempo de respuesta (promedio) 16.3s
#110	Gemini 3.1 Flash Lite Preview low	Google	7	6.5	$0.646	13/22	16.7s
Pruebas totales 22 Pruebas incorrectas 9 Costo total $0.646 Tiempo de respuesta (promedio) 16.7s
#16	GPT-5.3-Codex medium	OpenAI	4	8.9	$0.920	16/22	17.0s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.920 Tiempo de respuesta (promedio) 17.0s

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)