Muse Spark 1.1 (high) lidera na pontuação média com 8.0 vs 7.9. Qwen3.8 27B (low) tem menor custo de benchmark com ~$0.071 vs $1.709. Muse Spark 1.1 (high) é mais rápido com 30.84s vs 39.11s, com taxas de acerto de 68.2% vs 68.2%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-08-29
Posição
#53
Total de tokens de saída
363,989
Tempo de resposta (médio)
30.84s
Custo total
$1.709
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
Posição
#62
Total de tokens de saída
169,329
Tempo de resposta (médio)
39.11s
Custo total
~$0.071A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Modelo recomendadoQwen3.8 27B (low)
A pontuação fica perto da melhor aqui (7.9 vs 8.0) e custa cerca de 24.1x menos que Muse Spark 1.1 (high).
Qwen3.8 27BQwen3.8 27BlowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
Pontuação
8.0Pontuação média em todos os testes de benchmark.…
7.9Pontuação média em todos os testes de benchmark.…
Posição
#53
#62
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
7.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Sem resposta: 2Não seguiu as instruções: 1Tempo de resposta (médio)39.11sTempo de resposta (máx.)376.04sTempo de resposta (total)860.51sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Taxa de acerto por tentativa
68.2%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
68.2%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
6Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
64Execuções totais…
66Execuções totais…
Custo por resultado
14.236
~0.473A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Custo total
$1.709
~$0.071A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Preço de entrada
$1.250 / 1MPreço de entrada…
N/DPreço de entrada…
Preço de saída
$4.250 / 1MPreço de saída…
N/DPreço de saída…
Total de tokens de entrada
129,003Total de tokens de entrada…
99,705Total de tokens de entrada…
Tokens de saída
8,340Tokens de saída…
1,545Tokens de saída…
Tokens de raciocínio
355,649Tokens de raciocínio…
167,784Tokens de raciocínio…
Tempo de resposta (médio)
30.84sTempo de resposta (médio)…
39.11sTempo de resposta (médio)…
Tempo de resposta (máx.)
196.03sTempo de resposta (máx.)…
376.04sTempo de resposta (máx.)…
Tempo de resposta (total)
647.67sTempo de resposta (total)…
860.51sTempo de resposta (total)…
Parâmetros
~1T no total (~50B ativos)
27.3B
Disponibilidade
Código fechado
Pesos disponíveis
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#53 Muse Spark 1.1
high
Custo
$0.039
Tempo
50.1s
Tokens
9,423 tok
#62 Qwen3.8 27B
lowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
Custo
~$0.003A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
7.5Pontuação média em todos os testes de benchmark.…
8.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Resposta incorreta: 1Tempo de resposta (médio)8.60sTempo de resposta (máx.)15.63sTempo de resposta (total)34.39sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.60sTempo de resposta (médio)…
2,334Total de tokens de entrada…
516Tokens de saída…
13,023Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.02sTempo de resposta (máx.)5.68sTempo de resposta (total)12.07sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)22.92sTempo de resposta (máx.)27.22sTempo de resposta (total)68.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
22.92sTempo de resposta (médio)…
8,562Total de tokens de entrada…
349Tokens de saída…
36,039Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)140.92sTempo de resposta (máx.)376.04sTempo de resposta (total)422.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.9Pontuação média em todos os testes de benchmark.…
2.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 2Tempo de resposta (médio)70.25sTempo de resposta (máx.)78.10sTempo de resposta (total)140.51sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
70.25sTempo de resposta (médio)…
90,082Total de tokens de entrada…
5,535Tokens de saída…
68,439Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)90.63sTempo de resposta (máx.)143.71sTempo de resposta (total)181.27sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.40sTempo de resposta (máx.)10.84sTempo de resposta (total)16.81sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.40sTempo de resposta (médio)…
7,827Total de tokens de entrada…
240Tokens de saída…
5,907Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.03sTempo de resposta (máx.)9.09sTempo de resposta (total)16.06sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.9Pontuação média em todos os testes de benchmark.…
4.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
22.2%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Formatação extra: 1Resposta incorreta: 1Tempo de resposta (médio)60.59sTempo de resposta (máx.)67.02sTempo de resposta (total)121.18sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
60.59sTempo de resposta (médio)…
852Total de tokens de entrada…
329Tokens de saída…
67,684Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)60.78sTempo de resposta (máx.)120.94sTempo de resposta (total)182.34sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.73sTempo de resposta (máx.)7.73sTempo de resposta (total)7.73sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.73sTempo de resposta (médio)…
906Total de tokens de entrada…
116Tokens de saída…
3,390Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)5.37sTempo de resposta (máx.)5.37sTempo de resposta (total)5.37sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.4Pontuação média em todos os testes de benchmark.…
6.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)7.81sTempo de resposta (máx.)9.13sTempo de resposta (total)15.62sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.81sTempo de resposta (médio)…
1,527Total de tokens de entrada…
193Tokens de saída…
7,158Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.43sTempo de resposta (máx.)2.87sTempo de resposta (total)4.86sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.8Pontuação média em todos os testes de benchmark.…
9.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)69.96sTempo de resposta (máx.)196.03sTempo de resposta (total)209.89sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
69.96sTempo de resposta (médio)…
1,938Total de tokens de entrada…
225Tokens de saída…
140,780Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.91sTempo de resposta (máx.)8.81sTempo de resposta (total)14.74sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.6Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.88sTempo de resposta (máx.)9.88sTempo de resposta (total)9.88sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.88sTempo de resposta (médio)…
14,363Total de tokens de entrada…
795Tokens de saída…
2,938Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)8.42sTempo de resposta (máx.)8.42sTempo de resposta (total)8.42sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)22.93sTempo de resposta (máx.)22.93sTempo de resposta (total)22.93sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
22.93sTempo de resposta (médio)…
612Total de tokens de entrada…
42Tokens de saída…
10,291Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)12.64sTempo de resposta (máx.)12.64sTempo de resposta (total)12.64sUm teste é totalmente aprovado apenas quando todas as execuções passam.…