Navegação
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modelos comparados

Comparação benchmark GPT-5.5 (medium) vs GPT-5.4 (medium) vs Gemini 3.1 Pro Preview (medium) vs Claude Opus 4.7 (medium): Gemini 3.1 Pro Preview (medium) lidera em Pontuação com 9.2. GPT-5.5 (medium) lidera em Confiabilidade com 10.0. Gemini 3.1 Pro Preview (medium) tem o menor Custo total em $1.361. Claude Opus 4.7 (medium) é o mais rápido com 7.61s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-08-07

Posição
#15
Total de tokens de saída
124,436
Tempo de resposta (médio)
38.42s
Custo total
$4.137
Posição
#29
Total de tokens de saída
88,670
Tempo de resposta (médio)
23.10s
Custo total
$1.533
Posição
#9
Total de tokens de saída
97,958
Tempo de resposta (médio)
21.47s
Custo total
$1.361
Posição
#23
Total de tokens de saída
29,990
Tempo de resposta (médio)
7.61s
Custo total
$1.477
Modelo recomendado Gemini 3.1 Pro Preview (medium)

Tem a melhor pontuação aqui (9.2) e custa cerca de 1.8x menos que os outros modelos nesta comparação.

Comparação detalhada

Métrica GPT-5.5 GPT-5.5 medium Lançamento: 2026-04-24 GPT-5.4 GPT-5.4 medium Lançamento: 2026-03-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lançamento: 2026-02-19 Claude Opus 4.7 Claude Opus 4.7 medium Lançamento: 2026-04-16
Pontuação 9.0 8.5 9.2 8.7
Posição #15 #29 #9 #23
Confiabilidade 10.0 10.0 10.0 10.0
Consistência 8.9 8.6 10.0 9.6
Cobertura do benchmark 22/22 testes · 66/66 tentativas 22/22 testes · 66/66 tentativas 22/22 testes · 66/66 tentativas 22/22 testes · 66/66 tentativas
Testes corretos
Taxa de acerto por tentativa 87.9% 77.3% 90.9% 83.3%
Testes instáveis 3 4 0 1
Execuções totais 66 66 66 66
Custo por resultado 22.980 10.220 6.801 8.201
Custo total $4.137 $1.533 $1.361 $1.477
Preço de entrada $5.000 / 1M $2.500 / 1M $2.000 / 1M $5.000 / 1M
Preço de saída $30.000 / 1M $15.000 / 1M $12.000 / 1M $25.000 / 1M
Total de tokens de entrada 80,659 81,127 92,287 145,252
Tokens de saída 5,617 6,155 5,232 24,948
Tokens de raciocínio 118,819 82,515 92,726 5,042
Tempo de resposta (médio) 38.42s 23.10s 21.47s 7.61s
Tempo de resposta (máx.) 332.10s 100.41s 88.68s 65.40s
Tempo de resposta (total) 845.35s 508.26s 322.08s 159.91s

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 GPT-5.5

medium
Custo
$0.112
Tempo
71.9s
Tokens
3,807 tok

#29 GPT-5.4

medium
Custo
$0.214
Tempo
199.6s
Tokens
14,349 tok

#9 Gemini 3.1 Pro Preview

medium
Custo
$0.115
Tempo
87.2s
Tokens
9,629 tok

#23 Claude Opus 4.7

medium
Custo
$0.059
Tempo
26.8s
Tokens
2,475 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Comparação rápida

Trocar par de comparação