Navegação
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modelos comparados

Comparação benchmark GPT-5.5 (medium) vs GPT-5.4 (medium) vs Gemini 3.1 Pro Preview (medium) vs Claude Opus 4.7 (medium): Gemini 3.1 Pro Preview (medium) lidera em Pontuação com 9.2. GPT-5.5 (medium) lidera em Confiabilidade com 10.0. Gemini 3.1 Pro Preview (medium) tem o menor Custo total em $1.352. Claude Opus 4.7 (medium) é o mais rápido com 7.62s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-09-28

Modelos comparados

Posição
#33
Total de tokens de saída
125,316
Tempo de resposta (médio)
38.97s
Custo total
$4.163
Posição
#56
Total de tokens de saída
90,466
Tempo de resposta (médio)
22.85s
Custo total
$1.560
Posição
#22
Total de tokens de saída
97,238
Tempo de resposta (médio)
20.62s
Custo total
$1.352
Posição
#49
Total de tokens de saída
29,990
Tempo de resposta (médio)
7.62s
Custo total
$1.476
Modelo recomendado Gemini 3.1 Pro Preview (medium)

Tem a melhor pontuação aqui (9.2) e custa cerca de 1.8x menos que os outros modelos nesta comparação.

Comparação detalhada

Métrica GPT-5.5 GPT-5.5 medium Lançamento: 2026-04-24 GPT-5.4 GPT-5.4 medium Lançamento: 2026-03-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lançamento: 2026-02-19 Claude Opus 4.7 Claude Opus 4.7 medium Lançamento: 2026-04-16
Pontuação 9.0 8.5 9.2 8.7
Posição #33 #56 #22 #49
Confiabilidade 10.0 10.0 10.0 10.0
Consistência 8.9 8.6 10.0 9.6
Tentativas 66/66 66/66 66/66 66/66
Testes corretos
Taxa de acerto por tentativa 87.9% 77.3% 90.9% 83.3%
Testes instáveis 3 4 0 1
Execuções totais 66 66 66 66
Custo por resultado 23.127 10.399 6.758 8.200
Custo total $4.163 $1.560 $1.352 $1.476
Preço de entrada $5.000 / 1M $2.500 / 1M $2.000 / 1M $5.000 / 1M
Preço de saída $30.000 / 1M $15.000 / 1M $12.000 / 1M $25.000 / 1M
Total de tokens de entrada 80,668 81,136 92,296 145,249
Tokens de saída 5,617 6,155 5,232 24,948
Tokens de raciocínio 119,699 84,311 92,006 5,042
Tempo de resposta (médio) 38.97s 22.85s 20.62s 7.62s
Tempo de resposta (máx.) 332.10s 100.41s 88.68s 65.40s
Tempo de resposta (total) 857.43s 502.78s 329.94s 159.94s
Parâmetros ~1.5T no total (~100B ativos) ~1.5T no total (~100B ativos) ~1.2T no total (~20B ativos) ~5T no total (~500B ativos)
Disponibilidade Código fechado Código fechado Código fechado Código fechado

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#33 GPT-5.5

medium
Custo
$0.112
Tempo
71.9s
Tokens
3,807 tok

#56 GPT-5.4

medium
Custo
$0.214
Tempo
199.6s
Tokens
14,349 tok

#22 Gemini 3.1 Pro Preview

medium
Custo
$0.115
Tempo
87.2s
Tokens
9,629 tok

#49 Claude Opus 4.7

medium
Custo
$0.059
Tempo
26.8s
Tokens
2,475 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Comparação rápida

Trocar par de comparação