Navegação
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

OpenAI: GPT-5.3-Codex vs OpenAI: GPT-5.4

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-04

Métrica GPT-5.3-Codex GPT-5.3-Codex medium Lançamento: 2026-02-05 GPT-5.4 GPT-5.4 medium Lançamento: 2026-03-05
Pontuação 8.4 8.0
Posição #15 #21
Confiabilidade 10.0 10.0
Consistência 8.5 8.6
Testes corretos
Taxa de acerto por tentativa 82.5% 76.2%
Testes instáveis 4 4
Execuções totais 63 63
Custo por resultado 4.932 8.640
Custo total $0.740 $1.210
Preço de entrada $1.750 / 1M $2.500 / 1M
Preço de saída $14.000 / 1M $15.000 / 1M
Total de tokens de entrada 34,299 34,108
Tokens de saída 2,357 2,242
Tokens de raciocínio 46,189 72,707
Tempo de resposta (médio) 16.22s 22.35s
Tempo de resposta (máx.) 100.93s 100.41s
Tempo de resposta (total) 340.67s 469.29s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 8.7 7.9 91.7% 1 4.16s 606 240 1,722
GPT-5.4 8.3 10.0 75.0% 0 4.11s 606 240 1,511
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.56s 11,019 364 2,731
GPT-5.4 10.0 10.0 100.0% 0 20.57s 11,019 301 3,543
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.07s 7,140 234 728
GPT-5.4 10.0 10.0 100.0% 0 5.32s 7,140 234 804
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 5.9 7.2 55.6% 1 64.31s 813 64 25,308
GPT-5.4 5.3 7.2 44.4% 1 74.27s 619 61 34,748
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 4.6 10.0 0.0% 0 4.87s 477 187 331
GPT-5.4 4.7 3.1 33.3% 1 4.92s 477 145 321
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.04s 660 93 693
GPT-5.4 10.0 10.0 100.0% 0 3.11s 660 93 897
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 9.0 7.9 88.9% 1 5.05s 642 356 1,593
GPT-5.4 8.2 7.2 88.9% 1 9.14s 642 441 3,815
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 10.0 10.0 100.0% 0 6.37s 5,445 254 492
GPT-5.4 10.0 10.0 100.0% 0 13.28s 5,445 264 1,031
Conhecimentos gerais Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.3-Codex 2.8 1.6 33.3% 1 14.43s 195 30 1,701
GPT-5.4 3.0 10.0 0.0% 0 13.95s 195 30 1,821

Comparação rápida

Trocar par de comparação