Qwen3.8 27B lidera na pontuação média com 5.5 vs 5.4. O custo do hardware local não foi medido, por isso as comparações de custo não estão disponíveis. Qwen3.8 27B é mais rápido com 3.12s vs 111.60s, com taxas de acerto de 27.3% vs 40.9%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-08-15
Posição
#220
Total de tokens de saída
584,864
Tempo de resposta (médio)
111.60s
Custo total
$0.114
Posição
#211
Total de tokens de saída
11,445
Tempo de resposta (médio)
3.12s
Custo total
N/D
Modelo recomendadoQwen3.8 27B
Tem a melhor pontuação aqui (5.5) e responde cerca de 35.7x mais rápido que Laguna S 2.1 (high).
Qwen3.8 27BQwen3.8 27BnoneAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
Pontuação
5.4Pontuação média em todos os testes de benchmark.…
5.5Pontuação média em todos os testes de benchmark.…
Posição
#220
#211
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
8.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
3.4Pontuação média em todos os testes de benchmark.…
5.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
25.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Sem resposta: 1Tempo de resposta (médio)52.20sTempo de resposta (máx.)207.32sTempo de resposta (total)208.79sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
52.20sTempo de resposta (médio)…
672Total de tokens de entrada…
504Tokens de saída…
46,579Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)828msTempo de resposta (máx.)1.95sTempo de resposta (total)3.31sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.3Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
44.4%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Sem resposta: 1Tempo de resposta (médio)271.42sTempo de resposta (máx.)423.72sTempo de resposta (total)814.25sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
271.42sTempo de resposta (médio)…
6,496Total de tokens de entrada…
59,355Tokens de saída…
151,009Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)1.19sTempo de resposta (máx.)1.97sTempo de resposta (total)3.56sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.9Pontuação média em todos os testes de benchmark.…
6.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
16.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 2Tempo de resposta (médio)702.26sTempo de resposta (máx.)1190.11sTempo de resposta (total)1404.52sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
702.26sTempo de resposta (médio)…
184,420Total de tokens de entrada…
114,577Tokens de saída…
203,826Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Resposta incorreta: 1Tempo de resposta (médio)24.10sTempo de resposta (máx.)44.76sTempo de resposta (total)48.21sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.96sTempo de resposta (máx.)3.41sTempo de resposta (total)3.91sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.96sTempo de resposta (médio)…
7,689Total de tokens de entrada…
243Tokens de saída…
1,705Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.14sTempo de resposta (máx.)1.18sTempo de resposta (total)2.27sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)2.51sTempo de resposta (máx.)6.82sTempo de resposta (total)7.52sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.51sTempo de resposta (médio)…
771Total de tokens de entrada…
24Tokens de saída…
2,035Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)552msTempo de resposta (máx.)675msTempo de resposta (total)1.66sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.6Pontuação média em todos os testes de benchmark.…
9.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)855msTempo de resposta (máx.)855msTempo de resposta (total)855msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
855msTempo de resposta (médio)…
513Total de tokens de entrada…
135Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
4.2Pontuação média em todos os testes de benchmark.…
9.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.31sTempo de resposta (máx.)1.31sTempo de resposta (total)1.31sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.6Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Resposta incorreta: 1Tempo de resposta (médio)453msTempo de resposta (máx.)492msTempo de resposta (total)905msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
453msTempo de resposta (médio)…
702Total de tokens de entrada…
60Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
6.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)582msTempo de resposta (máx.)633msTempo de resposta (total)1.16sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.9Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
11.1%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Formatação extra: 1Tempo de resposta (médio)1.62sTempo de resposta (máx.)3.81sTempo de resposta (total)4.87sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.62sTempo de resposta (médio)…
699Total de tokens de entrada…
370Tokens de saída…
1,130Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
6.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Resposta incorreta: 1Tempo de resposta (médio)1.25sTempo de resposta (máx.)1.84sTempo de resposta (total)3.76sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.69sTempo de resposta (máx.)2.69sTempo de resposta (total)2.69sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.69sTempo de resposta (médio)…
6,747Total de tokens de entrada…
306Tokens de saída…
334Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.75sTempo de resposta (máx.)2.75sTempo de resposta (total)2.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)6.94sTempo de resposta (máx.)6.94sTempo de resposta (total)6.94sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.94sTempo de resposta (médio)…
228Total de tokens de entrada…
14Tokens de saída…
2,658Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)703msTempo de resposta (máx.)703msTempo de resposta (total)703msUm teste é totalmente aprovado apenas quando todas as execuções passam.…