AI BENCHY Compare

OpenAI: GPT-5.3-Codex vs Qwen: Qwen3.6 35B A3B

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-04-27

Métrica	GPT-5.3-Codex GPT-5.3-Codex medium Lanzamiento: 2026-02-05	Qwen3.6 35B A3B Qwen3.6 35B A3B medium Lanzamiento: 2026-04-20

Métrica	GPT-5.3-Codex GPT-5.3-Codex medium Lanzamiento: 2026-02-05	Qwen3.6 35B A3B Qwen3.6 35B A3B medium Lanzamiento: 2026-04-20
Puntuación	8.6	8.8
Rango	#11	#9
Fiabilidad	N/D	10.0
Consistencia	8.7	9.5
Pruebas correctas
Tasa de aciertos por intento	83.3%	83.3%
Pruebas inestables	3	1
Ejecuciones totales	54	54
Costo por resultado	4.405	0.800
Costo total	$0.573	$0.104
Precio de entrada	$1.750 / 1M	$0.162 / 1M
Precio de salida	$14.000 / 1M	$0.966 / 1M
Tokens de salida	2,279	14,256
Tokens de razonamiento	35,179	98,005
Tiempo de respuesta (promedio)	15.38s	11.98s
Tiempo de respuesta (máximo)	100.93s	45.02s
Tiempo de respuesta (total)	276.91s	191.76s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	240	1,722
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		6.02s	1,154	12,385

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	10.0	10.0	100.0%	0		8.95s	491	1,530
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		32.58s	3,294	15,116

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	364	2,731
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	234	728
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		12.99s	2,591	9,968

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	64	25,308
Qwen3.6 35B A3B	5.3	7.2	44.4%	1		22.50s	6,193	39,116

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	187	331
Qwen3.6 35B A3B	4.4	9.9	0.0%	0		8.66s	129	4,569

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	93	693
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		7.50s	219	7,404

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.12s	352	1,644
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		5.98s	676	9,447

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	254	492
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Comparación rápida

Cambiar par de comparación

Gemini 3 Flash PreviewlowvsQwen3.6 35B A3Bmedium GPT-5.3-CodexmediumvsHY3 PreviewhighDisponible gratis Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium GPT-5.5lowvsQwen3.6 35B A3Bmedium Qwen3.6 35B A3BmediumvsHY3 PreviewhighDisponible gratis Claude Opus 4.7nonevsQwen3.6 35B A3Bmedium GPT-5.3-CodexmediumvsHY3 PreviewlowDisponible gratis Gemini 3 Flash PreviewnonevsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium Claude Opus 4.7nonevsGPT-5.3-Codexmedium Qwen3.6 35B A3BmediumvsHY3 PreviewlowDisponible gratis Gemini 3 Flash PreviewnonevsQwen3.6 35B A3Bmedium