Comparar Gráficos Metodologia

Idioma:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.3-Codex vs OpenAI: GPT-5.4

Comparar:

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-06

Métrica	OpenAI: GPT-5.3-Codex medium Lançamento: 2026-02-05	OpenAI: GPT-5.4 medium Lançamento: 2026-03-05
Pontuação média	8.7	8.2
Posição	#4	#7
Testes corretos
Consistência	9.0	8.9
Custo por resultado	4.418	6.533
Custo total	$0.531	$0.784
Taxa de acerto por tentativa	88.9%	86.7%
Testes instáveis	2	2
common.totalRuns	45 (15 x 3)	45 (15 x 3)
Tokens de saída	1,577	1,611
Tokens de raciocínio	33,017	46,321
Tempo de resposta (médio)	17.37s	21.06s
Tempo de resposta (máx.)	100.93s	100.41s
Tempo de resposta (total)	260.52s	315.95s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação média vs Tempo de resposta (médio)

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
OpenAI: GPT-5.3-Codex	10.0	10.0	100.0%	0		4.69s	216	1,421
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		5.02s	216	1,466

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
OpenAI: GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	364	2,731
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
OpenAI: GPT-5.3-Codex	9.9	10.0	100.0%	0		3.07s	234	728
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		5.32s	234	804

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
OpenAI: GPT-5.3-Codex	4.0	7.2	55.6%	1		64.31s	64	25,308
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		74.27s	61	34,748

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
OpenAI: GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	93	693
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897

Puzzle Solving	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
OpenAI: GPT-5.3-Codex	9.3	7.9	88.9%	1		5.12s	352	1,644
OpenAI: GPT-5.4	7.0	7.2	88.9%	1		9.13s	442	3,832

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
OpenAI: GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	254	492
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031

Comparação rápida

Trocar par de comparação

Gemini 3 Flash PreviewlowvsGPT-5.4medium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.4medium Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4medium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.4medium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium Gemini 3 Flash PreviewnonevsGPT-5.4medium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.3-Codexmedium Claude Sonnet 4.6nonevsGPT-5.4medium Gemini 3 Flash PreviewnonevsGPT-5.3-Codexmedium GPT-5.4mediumvsQwen3.5 Plus 2026-02-15none