AI BENCHY Compare

OpenAI: GPT-4o-mini vs Qwen: Qwen3.6 Flash

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-21

Métrica	GPT-4o-mini GPT-4o-mini none Lanzamiento: 2024-07-18	Qwen3.6 Flash Qwen3.6 Flash none Lanzamiento: 2026-04-20

Métrica	GPT-4o-mini GPT-4o-mini none Lanzamiento: 2024-07-18	Qwen3.6 Flash Qwen3.6 Flash none Lanzamiento: 2026-04-20
Puntuación	4.9	5.6
Rango	#136	#114
Fiabilidad	10.0	10.0
Consistencia	9.9	10.0
Pruebas correctas
Tasa de aciertos por intento	26.3%	36.8%
Pruebas inestables	0	0
Ejecuciones totales	57	57
Costo por resultado	0.099	0.251
Costo total	$0.005	$0.018
Precio de entrada	$0.150 / 1M	$0.188 / 1M
Precio de salida	$0.600 / 1M	$1.125 / 1M
Tokens de salida	1,962	4,170
Tokens de razonamiento	0	0
Tiempo de respuesta (promedio)	1.90s	1.60s
Tiempo de respuesta (máximo)	7.58s	4.60s
Tiempo de respuesta (total)	22.79s	30.43s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	4.8	10.0	25.0%	0		1.34s	186	0
Qwen3.6 Flash	3.1	10.0	0.0%	0		1.63s	1,554	0

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.0	8.7	0.0%	0		2.55s	347	0
Qwen3.6 Flash	10.0	10.0	100.0%	0		2.23s	867	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.0	10.0	0.0%	0		7.58s	568	0
Qwen3.6 Flash	3.0	10.0	0.0%	0		4.22s	315	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	10.0	10.0	100.0%	0		1.27s	183	0
Qwen3.6 Flash	10.0	10.0	100.0%	0		2.13s	243	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.0	10.0	0.0%	0		637ms	15	0
Qwen3.6 Flash	5.3	10.0	33.3%	0		1.11s	15	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	4.0	10.0	0.0%	0		909ms	66	0
Qwen3.6 Flash	10.0	10.0	100.0%	0		947ms	132	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	6.3	10.0	50.0%	0		1.27s	69	0
Qwen3.6 Flash	6.3	10.0	50.0%	0		1.10s	66	0

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.5	10.0	0.0%	0		1.30s	308	0
Qwen3.6 Flash	3.5	10.0	0.0%	0		1.20s	697	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	10.0	10.0	100.0%	0		2.51s	205	0
Qwen3.6 Flash	10.0	10.0	100.0%	0		2.49s	272	0

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.0	10.0	0.0%	0		794ms	15	0
Qwen3.6 Flash	3.0	10.0	0.0%	0		649ms	9	0

Comparación rápida

Cambiar par de comparación

MiniMax M2.5mediumDisponible gratisvsQwen3.6 Flashnone Mistral Small 4mediumvsQwen3.6 Flashnone gpt-oss-120bmediumDisponible gratisvsQwen3.6 Flashnone Elephant AlphamediumvsQwen3.6 Flashnone GPT-4o-mininonevsQwen3 Coder Nextmedium MiniMax M2.7mediumvsGPT-4o-mininone CobuddymediumDisponible gratisvsQwen3.6 Flashnone Owl AlphamediumvsQwen3.6 Flashnone GPT-4o-mininonevsGLM 4.7 Flashmedium Nemotron 3 SupermediumDisponible gratisvsQwen3.6 Flashnone MiniMax M2.7mediumvsQwen3.6 Flashnone GPT-4o-mininonevsElephant Alphamedium