Qwen3.8 27B (low) lidera na pontuação média com 7.9 vs 7.7. Qwen3.8 27B (low) tem menor custo de benchmark com ~$0.071 vs $0.228. GLM 5 (medium) é mais rápido com 33.54s vs 39.11s, com taxas de acerto de 68.2% vs 78.8%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-08-20
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
Posição
#61
Total de tokens de saída
169,329
Tempo de resposta (médio)
39.11s
Custo total
~$0.071A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Posição
#72
Total de tokens de saída
124,566
Tempo de resposta (médio)
33.54s
Custo total
$0.228
Modelo recomendadoQwen3.8 27B (low)
Tem a melhor pontuação aqui (7.9) e custa cerca de 3.2x menos que GLM 5 (medium).
Comparação detalhada
Métrica
Qwen3.8 27BQwen3.8 27BlowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
GLM 5GLM 5medium63/66 tentativas (Meta: 3 repetições por teste)Lançamento: 2026-02-12
Métrica
Qwen3.8 27BQwen3.8 27BlowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
GLM 5GLM 5medium63/66 tentativas (Meta: 3 repetições por teste)Lançamento: 2026-02-12
Pontuação
7.9Pontuação média em todos os testes de benchmark.…
7.7Pontuação média em todos os testes de benchmark.…
Posição
#61
#72
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
8.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Tentativas
66/66
63/66
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Sem resposta: 2Não seguiu as instruções: 1Tempo de resposta (médio)39.11sTempo de resposta (máx.)376.04sTempo de resposta (total)860.51sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
68.2%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
78.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
4Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
66Execuções totais…
63Execuções totais…
Custo por resultado
~0.473A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
1.668
Custo total
~$0.071A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
$0.228
Preço de entrada
N/DPreço de entrada…
$0.600 / 1MPreço de entrada…
Preço de saída
N/DPreço de saída…
$1.920 / 1MPreço de saída…
Total de tokens de entrada
99,705Total de tokens de entrada…
35,224Total de tokens de entrada…
Tokens de saída
1,545Tokens de saída…
21,570Tokens de saída…
Tokens de raciocínio
167,784Tokens de raciocínio…
102,996Tokens de raciocínio…
Tempo de resposta (médio)
39.11sTempo de resposta (médio)…
33.54sTempo de resposta (médio)…
Tempo de resposta (máx.)
376.04sTempo de resposta (máx.)…
99.85sTempo de resposta (máx.)…
Tempo de resposta (total)
860.51sTempo de resposta (total)…
435.99sTempo de resposta (total)…
Parâmetros
27.3B
744B no total (40B ativos)
Disponibilidade
Pesos disponíveis
Código aberto
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#61 Qwen3.8 27B
lowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
Custo
~$0.003A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000000.
Tempo
92.8s
Tokens
6,902 tok
#72 GLM 5
medium
Custo
$0.005
Tempo
20.7s
Tokens
2,068 tok
Pontuação
-
Custo
-
Tempo
-
Tokens
-
Melhores modelos por pontuação
Pontuação vs custo total
Tempo de resposta (médio)
Pontuação vs Tempo de resposta (médio)
Total de tokens de saída
Pontuação vs Total de tokens de saída
Detalhamento por categoria
Truques anti-IA
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.02sTempo de resposta (máx.)5.68sTempo de resposta (total)12.07sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.66sTempo de resposta (máx.)25.06sTempo de resposta (total)47.32sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
23.66sTempo de resposta (médio)…
555Total de tokens de entrada…
480Tokens de saída…
7,056Tokens de raciocínio…
Programação
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)140.92sTempo de resposta (máx.)376.04sTempo de resposta (total)422.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)74.30sTempo de resposta (máx.)99.85sTempo de resposta (total)222.91sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
74.30sTempo de resposta (médio)…
7,254Total de tokens de entrada…
2,997Tokens de saída…
52,930Tokens de raciocínio…
Combinado
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)90.63sTempo de resposta (máx.)143.71sTempo de resposta (total)181.27sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.0Pontuação média em todos os testes de benchmark.…
5.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)28.96sTempo de resposta (máx.)28.96sTempo de resposta (total)28.96sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
28.96sTempo de resposta (médio)…
12,804Total de tokens de entrada…
662Tokens de saída…
3,242Tokens de raciocínio…
Análise e extração de dados
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.03sTempo de resposta (máx.)9.09sTempo de resposta (total)16.06sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.1Pontuação média em todos os testes de benchmark.…
5.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
83.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)8.90sTempo de resposta (máx.)8.90sTempo de resposta (total)8.90sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.90sTempo de resposta (médio)…
5,508Total de tokens de entrada…
567Tokens de saída…
3,734Tokens de raciocínio…
Específico do domínio
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)60.78sTempo de resposta (máx.)120.94sTempo de resposta (total)182.34sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.5Pontuação média em todos os testes de benchmark.…
4.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo esgotado: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
0msTempo de resposta (médio)…
260Total de tokens de entrada…
13,176Tokens de saída…
14,137Tokens de raciocínio…
Inteligência geral
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)5.37sTempo de resposta (máx.)5.37sTempo de resposta (total)5.37sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.1Pontuação média em todos os testes de benchmark.…
3.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)14.69sTempo de resposta (máx.)14.69sTempo de resposta (total)14.69sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
14.69sTempo de resposta (médio)…
477Total de tokens de entrada…
2,020Tokens de saída…
2,248Tokens de raciocínio…
Seguimento de instruções
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.43sTempo de resposta (máx.)2.87sTempo de resposta (total)4.86sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.25sTempo de resposta (máx.)7.25sTempo de resposta (total)7.25sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.25sTempo de resposta (médio)…
636Total de tokens de entrada…
1,001Tokens de saída…
2,129Tokens de raciocínio…
Resolução de quebra-cabeças
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.91sTempo de resposta (máx.)8.81sTempo de resposta (total)14.74sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.33sTempo de resposta (máx.)16.34sTempo de resposta (total)22.66sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
11.33sTempo de resposta (médio)…
609Total de tokens de entrada…
33Tokens de saída…
4,076Tokens de raciocínio…
Chamada de ferramentas
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)8.42sTempo de resposta (máx.)8.42sTempo de resposta (total)8.42sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)15.93sTempo de resposta (máx.)15.93sTempo de resposta (total)15.93sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
15.93sTempo de resposta (médio)…
6,935Total de tokens de entrada…
233Tokens de saída…
994Tokens de raciocínio…
Conhecimentos gerais
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)12.64sTempo de resposta (máx.)12.64sTempo de resposta (total)12.64sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)67.37sTempo de resposta (máx.)67.37sTempo de resposta (total)67.37sUm teste é totalmente aprovado apenas quando todas as execuções passam.…