AI BENCHY Compare

OpenAI: GPT-5.2 vs OpenAI: GPT-5.3 Chat

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-04-04

Métrica	GPT-5.2 GPT-5.2 medium Lançamento: 2025-12-11	GPT-5.3 Chat GPT-5.3 Chat none Lançamento: 2026-03-03

Métrica	GPT-5.2 GPT-5.2 medium Lançamento: 2025-12-11	GPT-5.3 Chat GPT-5.3 Chat none Lançamento: 2026-03-03
Pontuação	7.3	7.6
Posição	#37	#33
Consistência	8.0	8.6
Testes corretos
Taxa de acerto por tentativa	70.6%	66.7%
Testes instáveis	4	3
Execuções totais	51	51
Custo por resultado	3.131	3.177
Custo total	$0.314	$0.318
Preço de entrada	$1.750 / 1M	$1.750 / 1M
Preço de saída	$14.000 / 1M	$14.000 / 1M
Tokens de saída	2,238	19,348
Tokens de raciocínio	16,811	0
Tempo de resposta (médio)	13.93s	5.68s
Tempo de resposta (máx.)	77.80s	18.33s
Tempo de resposta (total)	139.29s	96.58s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.2	6.5	8.0	58.3%	1		7.81s	567	2,002
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	3,167	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.2	10.0	10.0	100.0%	0		14.06s	291	1,757
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	2,614	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.2	10.0	10.0	100.0%	0		3.15s	234	420
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	942	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.2	5.9	7.2	55.6%	1		77.80s	42	10,342
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	8,264	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.2	3.7	9.7	0.0%	0		4.32s	162	269
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	319	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.2	9.9	10.0	100.0%	0		3.12s	94	614
GPT-5.3 Chat	8.3	10.0	50.0%	0		3.29s	1,455	0

Puzzle Solving	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.2	7.7	7.3	77.8%	1		5.47s	609	938
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.93s	1,726	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.2	4.7	1.6	66.7%	1		10.30s	239	469
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	861	0

Comparação rápida

Trocar par de comparação

Claude Sonnet 4.6nonevsGPT-5.2medium GPT-5.3 ChatnonevsMiMo-V2-Flashmedium Claude Opus 4.6mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGLM 5V Turbomedium Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.5-35B-A3Bmedium GPT-5.3 ChatnonevsStep 3.5 FlashmediumDisponível grátis GPT-5.3 ChatnonevsGrok 4.20 Betamedium GPT-5.3 ChatnonevsMiMo-V2-Omnimedium Kimi K2.5mediumvsGPT-5.3 Chatnone Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2-Promedium