Ranking de fallos por Respuesta incorrecta

Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Puntuación ↑.

Modelos mostrados

Fallos totales

1585

Modelo más afectado

LFM2-24B-A2B 9

Categorías

En la categoría Específico del dominio421 En la categoría Trucos anti-IA293 En la categoría Programación259 En la categoría Resolución de acertijos204 En la categoría Cultura general172 En la categoría Combinado69 En la categoría Inteligencia general62 En la categoría Seguimiento de instrucciones61 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3

215/215

Rango	Modelo	Empresa	Cantidad de Respuesta incorrecta	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#66	KAT-Coder-Pro V2.5 low	Kwaipilot	10	7.4	$0.387	11/22	19.5s
Pruebas totales 22 Pruebas incorrectas 11 Costo total $0.387 Tiempo de respuesta (promedio) 19.5s
#65	Gemini 3 Flash Preview low	Google	6	7.4	$0.177	16/22	6.28s
Pruebas totales 22 Pruebas incorrectas 6 Costo total $0.177 Tiempo de respuesta (promedio) 6.28s
#64	LongCat 2.0 medium	Meituan	7	7.4	$0.478	12/22	136.6s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.478 Tiempo de respuesta (promedio) 136.6s
#63	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
Pruebas totales 22 Pruebas incorrectas 7 Costo total $0.197 Tiempo de respuesta (promedio) 4.52s
#62	Qwen3.5-27B medium	Qwen	4	7.4	$1.627	13/22	111.9s
Pruebas totales 22 Pruebas incorrectas 9 Costo total $1.627 Tiempo de respuesta (promedio) 111.9s
#61	Qwen3.5 Plus 2026-02-15 medium	Qwen	4	7.5	$0.437	14/22	89.2s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.437 Tiempo de respuesta (promedio) 89.2s
#60	GPT-5.4 Mini medium	OpenAI	6	7.5	$0.756	12/22	25.9s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.756 Tiempo de respuesta (promedio) 25.9s
#59	GPT-5.6 Terra low	OpenAI	8	7.5	$0.519	13/22	5.31s
Pruebas totales 22 Pruebas incorrectas 9 Costo total $0.519 Tiempo de respuesta (promedio) 5.31s
#58	GPT-5.3 Chat none	OpenAI	7	7.5	$0.571	13/22	6.88s
Pruebas totales 22 Pruebas incorrectas 9 Costo total $0.571 Tiempo de respuesta (promedio) 6.88s
#57	GPT-5.4 Nano medium	OpenAI	8	7.5	$0.138	12/22	13.2s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.138 Tiempo de respuesta (promedio) 13.2s
#56	Kimi K2.7 Code medium	Moonshot AI	5	7.5	$0.740	12/22	84.2s
Pruebas totales 22 Pruebas incorrectas 10 Costo total $0.740 Tiempo de respuesta (promedio) 84.2s
#55	Nemotron 3 Ultra medium	NVIDIA	7	7.5	$0.774	13/22	32.2s
Pruebas totales 22 Pruebas incorrectas 9 Costo total $0.774 Tiempo de respuesta (promedio) 32.2s
#54	GPT-5.6 Luna medium	OpenAI	8	7.6	$0.352	14/22	7.28s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $0.352 Tiempo de respuesta (promedio) 7.28s
#53	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Pruebas totales 21 Pruebas incorrectas 7 Costo total $0.323 Tiempo de respuesta (promedio) 23.0s
#52	Grok Build 0.1 medium	X AI	5	7.6	$1.097	14/22	52.1s
Pruebas totales 22 Pruebas incorrectas 8 Costo total $1.097 Tiempo de respuesta (promedio) 52.1s

Fallos por Respuesta incorrecta

Filtrar modelos

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)