Qwen3.8 27B (medium) lidera na pontuação média com 7.2 vs 7.1. Qwen3.8 27B (medium) tem menor custo de benchmark com ~$0.073 vs $2.766. Claude Opus 5 é mais rápido com 10.78s vs 40.09s, com taxas de acerto de 55.1% vs 66.7%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-10-01
Modelos comparados
Posição
#149
Total de tokens de saída
31,386
Tempo de resposta (médio)
10.78s
Custo total
$2.766
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
Posição
#141
Total de tokens de saída
170,696
Tempo de resposta (médio)
40.09s
Custo total
~$0.073A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Modelo recomendadoQwen3.8 27B (medium)
Tem a melhor pontuação aqui (7.2) e custa cerca de 38.1x menos que Claude Opus 5.
Qwen3.8 27BQwen3.8 27BmediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14Disponível grátis
Qwen3.8 27BQwen3.8 27BmediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14Disponível grátis
Pontuação
7.1Pontuação média em todos os testes de benchmark.…
7.2Pontuação média em todos os testes de benchmark.…
Posição
#149
#141
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
9.7Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
9.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
9.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
55.1%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
69Execuções totais…
69Execuções totais…
Custo por resultado
23.044
~0.520A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Custo total
$2.766
~$0.073A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Preço de entrada
$5.000 / 1MPreço de entrada…
N/DPreço de entrada…
Preço de saída
$25.000 / 1MPreço de saída…
N/DPreço de saída…
Total de tokens de entrada
396,120Total de tokens de entrada…
277,164Total de tokens de entrada…
Tokens de saída
31,386Tokens de saída…
1,913Tokens de saída…
Tokens de raciocínio
0Tokens de raciocínio…
168,783Tokens de raciocínio…
Tempo de resposta (médio)
10.78sTempo de resposta (médio)…
40.09sTempo de resposta (médio)…
Tempo de resposta (máx.)
79.61sTempo de resposta (máx.)…
214.63sTempo de resposta (máx.)…
Tempo de resposta (total)
247.96sTempo de resposta (total)…
881.89sTempo de resposta (total)…
Parâmetros
~5T no total (~500B ativos)
27.3B
Disponibilidade
Código fechado
Pesos disponíveis
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#149 Claude Opus 5
none
Custo
$0.271
Tempo
149.3s
Tokens
10,962 tok
#141 Qwen3.8 27B
mediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
Custo
~$0.002A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
5.4Pontuação média em todos os testes de benchmark.…
9.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)79.61sTempo de resposta (máx.)79.61sTempo de resposta (total)79.61sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
79.61sTempo de resposta (médio)…
210,573Total de tokens de entrada…
6,520Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
4.7Pontuação média em todos os testes de benchmark.…
1.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)187.85sTempo de resposta (máx.)187.85sTempo de resposta (total)187.85sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.5Pontuação média em todos os testes de benchmark.…
8.3A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
41.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)4.33sTempo de resposta (máx.)9.08sTempo de resposta (total)17.30sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.33sTempo de resposta (médio)…
834Total de tokens de entrada…
1,398Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.93sTempo de resposta (máx.)5.18sTempo de resposta (total)11.70sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.9Pontuação média em todos os testes de benchmark.…
9.7A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Resposta incorreta: 1Tempo de resposta (médio)5.54sTempo de resposta (máx.)8.42sTempo de resposta (total)16.63sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.54sTempo de resposta (médio)…
10,590Total de tokens de entrada…
2,886Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)40.50sTempo de resposta (máx.)72.14sTempo de resposta (total)121.51sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)30.54sTempo de resposta (máx.)47.72sTempo de resposta (total)61.09sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
30.54sTempo de resposta (médio)…
148,140Total de tokens de entrada…
13,011Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
8.7Pontuação média em todos os testes de benchmark.…
6.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
83.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)124.48sTempo de resposta (máx.)214.63sTempo de resposta (total)248.96sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.88sTempo de resposta (máx.)4.06sTempo de resposta (total)7.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.88sTempo de resposta (médio)…
10,503Total de tokens de entrada…
309Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)8.76sTempo de resposta (máx.)10.36sTempo de resposta (total)17.53sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)11.10sTempo de resposta (máx.)26.91sTempo de resposta (total)33.31sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
11.10sTempo de resposta (médio)…
972Total de tokens de entrada…
5,440Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)76.98sTempo de resposta (máx.)144.07sTempo de resposta (total)230.93sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.70sTempo de resposta (máx.)3.70sTempo de resposta (total)3.70sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.70sTempo de resposta (médio)…
708Total de tokens de entrada…
316Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)9.20sTempo de resposta (máx.)9.20sTempo de resposta (total)9.20sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.81sTempo de resposta (máx.)2.98sTempo de resposta (total)5.62sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.81sTempo de resposta (médio)…
909Total de tokens de entrada…
99Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.54sTempo de resposta (máx.)2.67sTempo de resposta (total)5.07sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Tempo de resposta (médio)3.66sTempo de resposta (máx.)4.75sTempo de resposta (total)10.98sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.66sTempo de resposta (médio)…
894Total de tokens de entrada…
874Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
8.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)12.62sTempo de resposta (máx.)29.62sTempo de resposta (total)37.85sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.89sTempo de resposta (máx.)7.89sTempo de resposta (total)7.89sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.89sTempo de resposta (médio)…
11,739Total de tokens de entrada…
355Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)4.08sTempo de resposta (máx.)4.08sTempo de resposta (total)4.08sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.08sTempo de resposta (médio)…
258Total de tokens de entrada…
178Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)11.29sTempo de resposta (máx.)11.29sTempo de resposta (total)11.29sUm teste é totalmente aprovado apenas quando todas as execuções passam.…