Navegação
AI BENCHY
Advertise here

DeepSeek V3.2 (medium) vs Muse Glimmer 30B (low)

Muse Glimmer 30B (low) lidera na pontuação média com 7.1 vs 7.0. DeepSeek V3.2 (medium) tem menor custo de benchmark com $0.078 vs $0.186. Muse Glimmer 30B (low) é mais rápido com 18.51s vs 68.62s, com taxas de acerto de 65.2% vs 63.6%.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-08-11

Posição
#102
Total de tokens de saída
128,848
Tempo de resposta (médio)
68.62s
Custo total
$0.078
Posição
#99
Total de tokens de saída
95,478
Tempo de resposta (médio)
18.51s
Custo total
$0.186
Modelo recomendado Muse Glimmer 30B (low)

Tem a melhor pontuação aqui (7.1) e responde cerca de 3.7x mais rápido que DeepSeek V3.2 (medium).

Comparação detalhada

Métrica DeepSeek V3.2 DeepSeek V3.2 medium Lançamento: 2025-12-01 Muse Glimmer 30B Muse Glimmer 30B low Lançamento: 2026-08-11
Pontuação 7.0 7.1
Posição #102 #99
Confiabilidade 10.0 10.0
Consistência 7.4 8.2
Cobertura do benchmark 22/22 testes · 66/66 tentativas 22/22 testes · 66/66 tentativas
Testes corretos
Taxa de acerto por tentativa 65.2% 63.6%
Testes instáveis 7 5
Execuções totais 66 66
Custo por resultado 0.671 1.685
Custo total $0.078 $0.186
Preço de entrada $0.269 / 1M $0.350 / 1M
Preço de saída $0.400 / 1M $1.500 / 1M
Total de tokens de entrada 101,047 130,300
Tokens de saída 11,834 33,907
Tokens de raciocínio 117,014 61,571
Tempo de resposta (médio) 68.62s 18.51s
Tempo de resposta (máx.) 376.10s 234.92s
Tempo de resposta (total) 1509.53s 407.22s

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#102 DeepSeek V3.2

medium
Custo
$0.001
Tempo
53.6s
Tokens
1,932 tok

#99 Muse Glimmer 30B

low
Custo
$0.002
Tempo
13.5s
Tokens
953 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
DeepSeek V3.2 6.0 7.2 55.6% 1 248.68s 5,717 649 52,014
Muse Glimmer 30B 8.1 9.9 66.7% 0 16.52s 7,419 2,759 10,173

Comparação rápida

Trocar par de comparação