Navegação
Advertise here

Modelos comparados

Comparação benchmark Claude Opus 5 (high) vs Claude Opus 4.6 (medium) vs Claude Opus 5 (low) vs Claude Opus 5: Claude Opus 5 (high) lidera em Pontuação com 9.2. Claude Opus 5 (high) lidera em Confiabilidade com 10.0. Claude Opus 5 (low) tem o menor Custo total em $1.121. Claude Opus 5 (low) é o mais rápido com 6.99s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-09-10

Modelos comparados

Posição
#20
Total de tokens de saída
95,583
Tempo de resposta (médio)
22.51s
Custo total
$3.070
Posição
#94
Total de tokens de saída
96,722
Tempo de resposta (médio)
32.23s
Custo total
$2.961
Posição
#40
Total de tokens de saída
17,992
Tempo de resposta (médio)
6.99s
Custo total
$1.121
Posição
#101
Total de tokens de saída
24,866
Tempo de resposta (médio)
7.65s
Custo total
$1.550
Modelo recomendado Claude Opus 5 (low)

A pontuação fica perto da melhor aqui (8.7 vs 9.2) e custa cerca de 2.3x menos que os outros modelos nesta comparação.

Comparação detalhada

Métrica Claude Opus 5 Claude Opus 5 high Lançamento: 2026-07-25 Claude Opus 4.6 Claude Opus 4.6 medium Lançamento: 2026-02-05 Claude Opus 5 Claude Opus 5 low Lançamento: 2026-07-25 Claude Opus 5 Claude Opus 5 none Lançamento: 2026-07-25
Pontuação 9.2 7.7 8.7 7.5
Posição #20 #94 #40 #101
Confiabilidade 10.0 10.0 10.0 10.0
Consistência 10.0 8.8 9.6 9.6
Tentativas 66/66 66/66 66/66 66/66
Testes corretos
Taxa de acerto por tentativa 81.8% 63.6% 83.3% 57.6%
Testes instáveis 0 3 1 1
Execuções totais 66 66 66 66
Custo por resultado 17.052 22.777 6.223 12.912
Custo total $3.070 $2.961 $1.121 $1.550
Preço de entrada $5.000 / 1M $5.000 / 1M $5.000 / 1M $5.000 / 1M
Preço de saída $25.000 / 1M $25.000 / 1M $25.000 / 1M $25.000 / 1M
Total de tokens de entrada 135,956 108,573 134,770 185,547
Tokens de saída 64,624 69,994 13,604 24,866
Tokens de raciocínio 30,959 26,728 4,388 0
Tempo de resposta (médio) 22.51s 32.23s 6.99s 7.65s
Tempo de resposta (máx.) 159.01s 151.51s 30.67s 47.72s
Tempo de resposta (total) 495.12s 515.65s 153.80s 168.35s
Parâmetros ~5T no total (~500B ativos) ~5T no total (~500B ativos) ~5T no total (~500B ativos) ~5T no total (~500B ativos)
Disponibilidade Código fechado Código fechado Código fechado Código fechado

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#20 Claude Opus 5

high
Custo
$0.265
Tempo
144.5s
Tokens
10,741 tok

#94 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Custo
$0.000
Tempo
300.0s
Tokens
0 tok

#40 Claude Opus 5

low
Custo
$0.062
Tempo
30.2s
Tokens
2,615 tok

#101 Claude Opus 5

none
Custo
$0.271
Tempo
149.3s
Tokens
10,962 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 5 10.0 10.0 100.0% 0 12.73s 10,590 7,547 1,721
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Opus 5 7.8 7.4 77.8% 1 6.70s 10,590 2,442 760
Claude Opus 5 5.9 9.7 33.3% 0 5.54s 10,590 2,886 0

Comparação rápida

Trocar par de comparação