Navegação
Advertise here

Claude Opus 4.8 vs Ember-1 (low)

Ember-1 (low) lidera na pontuação média com 7.0 vs 6.9. Ember-1 (low) tem menor custo de benchmark com $1.488 vs $2.334. Claude Opus 4.8 é mais rápido com 7.54s vs 34.90s, com taxas de acerto de 60.9% vs 65.2%.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-10-01

Modelos comparados

Posição
#167
Total de tokens de saída
24,343
Tempo de resposta (médio)
7.54s
Custo total
$2.334
Posição
#157
Total de tokens de saída
56,766
Tempo de resposta (médio)
34.90s
Custo total
$1.488
Modelo recomendado Claude Opus 4.8

A pontuação fica perto da melhor aqui (6.9 vs 7.0) e responde cerca de 4.6x mais rápido que Ember-1 (low).

Comparação detalhada

Métrica Claude Opus 4.8 Claude Opus 4.8 none Lançamento: 2026-05-28 Ember-1 Ember-1 low Lançamento: 2026-09-28
Pontuação 6.9 7.0
Posição #167 #157
Confiabilidade 10.0 8.8
Consistência 9.3 8.2
Tentativas 69/69 69/69
Testes corretos
Taxa de acerto por tentativa 60.9% 65.2%
Testes instáveis 2 5
Execuções totais 69 69
Custo por resultado 17.953 11.441
Custo total $2.334 $1.488
Preço de entrada $5.000 / 1M $3.000 / 1M
Preço de saída $25.000 / 1M $15.000 / 1M
Total de tokens de entrada 345,059 211,908
Tokens de saída 24,343 14,158
Tokens de raciocínio 0 42,608
Tempo de resposta (médio) 7.54s 34.90s
Tempo de resposta (máx.) 65.07s 121.29s
Tempo de resposta (total) 173.31s 802.79s
Parâmetros ~5T no total (~500B ativos) ~2.8T no total (~104B ativos)
Disponibilidade Código fechado Código fechado

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#167 Claude Opus 4.8

none
Custo
$0.053
Tempo
22.0s
Tokens
2,253 tok

#157 Ember-1

low
Custo
$0.016
Tempo
24.2s
Tokens
1,165 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
Ember-1 10.0 10.0 100.0% 0 37.91s 8,097 2,518 13,142

Comparação rápida

Trocar par de comparação