Navegação
AI BENCHY
Advertise here

Claude Opus 5 vs Meta: Muse Spark 1.1

A pontuação média está praticamente empatada em 8.6 vs 8.6. Claude Opus 5 (low) tem menor custo de benchmark com $1.121 vs $1.357. Claude Opus 5 (low) é mais rápido com 6.99s vs 24.97s, com taxas de acerto de 80.3% vs 72.7%.

Modelo recomendadoClaude Opus 5 (low)Tem a melhor pontuação aqui (8.6) e responde cerca de 3.6x mais rápido que Muse Spark 1.1 (medium).

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-07-25

Métrica Claude Opus 5 Claude Opus 5 low Lançamento: 2026-07-25 Muse Spark 1.1 Muse Spark 1.1 medium Lançamento: 2026-07-16
Pontuação 8.6 8.6
Posição #23 #21
Confiabilidade 10.0 10.0
Consistência 9.3 9.2
Testes corretos
Taxa de acerto por tentativa 80.3% 72.7%
Testes instáveis 2 2
Execuções totais 66 66
Custo por resultado 6.593 9.041
Custo total $1.121 $1.357
Preço de entrada $5.000 / 1M $1.250 / 1M
Preço de saída $25.000 / 1M $4.250 / 1M
Total de tokens de entrada 134,773 142,567
Tokens de saída 14,123 7,905
Tokens de raciocínio 3,896 269,225
Tempo de resposta (médio) 6.99s 24.97s
Tempo de resposta (máx.) 30.67s 165.38s
Tempo de resposta (total) 153.73s 549.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#23 Claude Opus 5

low
Custo
$0.062
Tempo
30.2s
Tokens
2,615 tok

#21 Muse Spark 1.1

medium
Custo
$0.024
Tempo
29.2s
Tokens
5,774 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 5 7.8 7.4 77.8% 1 6.70s 10,590 2,442 760
Muse Spark 1.1 10.0 10.0 100.0% 0 15.66s 8,562 347 23,562

Comparação rápida

Trocar par de comparação