Navegação
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modelos comparados

Comparação benchmark Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): Gemini 3.1 Pro Preview (medium) lidera em Pontuação com 9.2. Claude Opus 4.6 (medium) lidera em Confiabilidade com 10.0. GPT-5.3-Codex (medium) tem o menor Custo total em $0.920. GPT-5.3-Codex (medium) é o mais rápido com 16.96s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-08-07

Posição
#60
Total de tokens de saída
100,601
Tempo de resposta (médio)
34.27s
Custo total
$3.059
Posição
#56
Total de tokens de saída
115,865
Tempo de resposta (médio)
25.91s
Custo total
$2.057
Posição
#18
Total de tokens de saída
55,525
Tempo de resposta (médio)
16.96s
Custo total
$0.920
Posição
#9
Total de tokens de saída
97,958
Tempo de resposta (médio)
21.47s
Custo total
$1.361
Modelo recomendado GPT-5.3-Codex (medium)

A pontuação fica perto da melhor aqui (8.9 vs 9.2) e custa cerca de 2.3x menos que os outros modelos nesta comparação.

Comparação detalhada

Métrica Claude Opus 4.6 Claude Opus 4.6 medium Lançamento: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lançamento: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Lançamento: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lançamento: 2026-02-19
Pontuação 7.7 7.8 8.9 9.2
Posição #60 #56 #18 #9
Confiabilidade 10.0 10.0 10.0 10.0
Consistência 8.8 9.2 8.6 10.0
Cobertura do benchmark 22/22 testes · 66/66 tentativas 22/22 testes · 66/66 tentativas 22/22 testes · 66/66 tentativas 22/22 testes · 66/66 tentativas
Testes corretos
Taxa de acerto por tentativa 63.6% 66.7% 83.3% 90.9%
Testes instáveis 3 2 4 0
Execuções totais 66 66 66 66
Custo por resultado 23.524 14.692 5.748 6.801
Custo total $3.059 $2.057 $0.920 $1.361
Preço de entrada $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Preço de saída $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Total de tokens de entrada 108,615 106,292 81,268 92,287
Tokens de saída 72,286 80,748 6,251 5,232
Tokens de raciocínio 28,315 35,117 49,274 92,726
Tempo de resposta (médio) 34.27s 25.91s 16.96s 21.47s
Tempo de resposta (máx.) 151.51s 140.96s 100.93s 88.68s
Tempo de resposta (total) 513.99s 362.78s 373.19s 322.08s

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
SVG inválido
Custo
$0.000
Tempo
300.0s
Tokens
0 tok

#56 Claude Sonnet 4.6

medium
SVG inválido
Custo
$0.000
Tempo
300.0s
Tokens
0 tok

#18 GPT-5.3-Codex

medium
Custo
$0.049
Tempo
54.9s
Tokens
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
Custo
$0.115
Tempo
87.2s
Tokens
9,629 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Comparação rápida

Trocar par de comparação