AI BENCHY Compare

OpenAI: GPT-5.2 vs OpenAI: GPT-5.3 Chat

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-04-04

Métrica	GPT-5.2 GPT-5.2 medium Lanzamiento: 2025-12-11	GPT-5.3 Chat GPT-5.3 Chat none Lanzamiento: 2026-03-03

Métrica	GPT-5.2 GPT-5.2 medium Lanzamiento: 2025-12-11	GPT-5.3 Chat GPT-5.3 Chat none Lanzamiento: 2026-03-03
Puntuación	7.3	7.6
Rango	#37	#33
Consistencia	8.0	8.6
Pruebas correctas
Tasa de aciertos por intento	70.6%	66.7%
Pruebas inestables	4	3
Ejecuciones totales	51	51
Costo por resultado	3.131	3.177
Costo total	$0.314	$0.318
Precio de entrada	$1.750 / 1M	$1.750 / 1M
Precio de salida	$14.000 / 1M	$14.000 / 1M
Tokens de salida	2,238	19,348
Tokens de razonamiento	16,811	0
Tiempo de respuesta (promedio)	13.93s	5.68s
Tiempo de respuesta (máximo)	77.80s	18.33s
Tiempo de respuesta (total)	139.29s	96.58s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.2	6.5	8.0	58.3%	1		7.81s	567	2,002
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	3,167	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.2	10.0	10.0	100.0%	0		14.06s	291	1,757
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	2,614	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.2	10.0	10.0	100.0%	0		3.15s	234	420
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	942	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.2	5.9	7.2	55.6%	1		77.80s	42	10,342
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	8,264	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.2	3.7	9.7	0.0%	0		4.32s	162	269
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	319	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.2	9.9	10.0	100.0%	0		3.12s	94	614
GPT-5.3 Chat	8.3	10.0	50.0%	0		3.29s	1,455	0

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.2	7.7	7.3	77.8%	1		5.47s	609	938
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.93s	1,726	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.2	4.7	1.6	66.7%	1		10.30s	239	469
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	861	0

Comparación rápida

Cambiar par de comparación

Claude Sonnet 4.6nonevsGPT-5.2medium GPT-5.3 ChatnonevsMiMo-V2-Flashmedium Claude Opus 4.6mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGLM 5V Turbomedium Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.5-35B-A3Bmedium GPT-5.3 ChatnonevsStep 3.5 FlashmediumDisponible gratis GPT-5.3 ChatnonevsGrok 4.20 Betamedium GPT-5.3 ChatnonevsMiMo-V2-Omnimedium Kimi K2.5mediumvsGPT-5.3 Chatnone Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2-Promedium