Navegação
AI BENCHY
Your ad here

AI BENCHY Compare

Modelos comparados

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-12

Métrica GPT-5.2 GPT-5.2 medium Lançamento: 2025-12-11 GPT-5.3 Chat GPT-5.3 Chat none Lançamento: 2026-03-03 GPT-5.4 GPT-5.4 none Lançamento: 2026-03-05
Posição #29 #20 #51
Pontuação média 6.5 7.3 4.5
Consistência 7.9 8.5 8.9
Custo por resultado 3.125 3.163 1.562
Custo total $0.313 $0.317 $0.094
Testes corretos
Taxa de acerto por tentativa 75.0% 70.8% 41.7%
Testes instáveis 4 3 2
Execuções totais 48 48 48
Tokens de saída 2,220 19,272 1,819
Tokens de raciocínio 16,811 0 0
Tempo de resposta (médio) 15.33s 5.96s 1.48s
Tempo de resposta (máx.) 77.80s 18.33s 2.89s
Tempo de resposta (total) 138.01s 95.30s 23.64s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação média vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação média vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-5.2 7.0 7.3 77.8% 1 14.34s 549 2,002
GPT-5.3 Chat 7.3 7.5 77.8% 1 4.72s 3,091 0
GPT-5.4 10.0 7.3 11.1% 1 1.41s 388 0
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-5.2 10.0 10.0 100.0% 0 14.06s 291 1,757
GPT-5.3 Chat 10.0 10.0 100.0% 0 11.96s 2,614 0
GPT-5.4 10.0 10.0 0.0% 0 2.89s 291 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-5.2 9.9 10.0 100.0% 0 3.15s 234 420
GPT-5.3 Chat 9.9 10.0 100.0% 0 2.21s 942 0
GPT-5.4 9.9 10.0 100.0% 0 1.04s 222 0
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-5.2 4.0 7.2 55.6% 1 77.80s 42 10,342
GPT-5.3 Chat 10.0 4.4 33.3% 2 13.01s 8,264 0
GPT-5.4 4.0 7.2 44.4% 1 1.07s 50 0
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-5.2 10.0 9.7 0.0% 0 4.32s 162 269
GPT-5.3 Chat 4.0 10.0 0.0% 0 1.99s 319 0
GPT-5.4 3.0 9.9 0.0% 0 1.78s 184 0
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-5.2 9.5 10.0 100.0% 0 3.12s 94 614
GPT-5.3 Chat 9.0 10.0 50.0% 0 3.29s 1,455 0
GPT-5.4 5.5 10.0 50.0% 0 1.07s 81 0
Puzzle Solving Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-5.2 7.0 7.3 77.8% 1 5.47s 609 938
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.93s 1,726 0
GPT-5.4 4.0 9.8 33.3% 0 1.52s 357 0
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-5.2 10.0 1.6 66.7% 1 10.30s 239 469
GPT-5.3 Chat 10.0 10.0 100.0% 0 8.36s 861 0
GPT-5.4 10.0 10.0 100.0% 0 2.75s 246 0

Comparação rápida

Trocar par de comparação