A pontuação média está praticamente empatada em 7.8 vs 7.8. O custo do hardware local não foi medido, por isso as comparações de custo não estão disponíveis. Qwen3.8 27B (medium) é mais rápido com 33.05s vs 41.37s, com taxas de acerto de 71.2% vs 66.7%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-08-15
Posição
#71
Total de tokens de saída
370,250
Tempo de resposta (médio)
41.37s
Custo total
$0.052
Posição
#68
Total de tokens de saída
136,162
Tempo de resposta (médio)
33.05s
Custo total
N/D
Modelo recomendadoQwen3.7 Flash (high)
Tem a pontuação mais forte nesta comparação (7.8) e o melhor equilíbrio geral entre custo e tempo de resposta entre os 2 modelos.
Qwen3.8 27BQwen3.8 27BmediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
Pontuação
7.8Pontuação média em todos os testes de benchmark.…
7.8Pontuação média em todos os testes de benchmark.…
Posição
#71
#68
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
9.6Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
7.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
9.7A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)10.21sTempo de resposta (máx.)15.82sTempo de resposta (total)40.82sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.21sTempo de resposta (médio)…
672Total de tokens de entrada…
713Tokens de saída…
13,968Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.93sTempo de resposta (máx.)5.18sTempo de resposta (total)11.70sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.2Pontuação média em todos os testes de benchmark.…
9.7A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)58.84sTempo de resposta (máx.)69.05sTempo de resposta (total)176.53sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
58.84sTempo de resposta (médio)…
7,893Total de tokens de entrada…
503Tokens de saída…
62,350Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)40.50sTempo de resposta (máx.)72.14sTempo de resposta (total)121.51sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.9Pontuação média em todos os testes de benchmark.…
5.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)231.97sTempo de resposta (máx.)431.47sTempo de resposta (total)463.94sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
231.97sTempo de resposta (médio)…
88,896Total de tokens de entrada…
9,866Tokens de saída…
203,866Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
8.7Pontuação média em todos os testes de benchmark.…
6.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
83.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)124.48sTempo de resposta (máx.)214.63sTempo de resposta (total)248.96sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)20.10sTempo de resposta (máx.)26.73sTempo de resposta (total)40.19sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
20.10sTempo de resposta (médio)…
7,782Total de tokens de entrada…
270Tokens de saída…
10,800Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)8.76sTempo de resposta (máx.)10.36sTempo de resposta (total)17.53sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.9Pontuação média em todos os testes de benchmark.…
4.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
22.2%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)34.43sTempo de resposta (máx.)56.51sTempo de resposta (total)103.29sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
34.43sTempo de resposta (médio)…
780Total de tokens de entrada…
59Tokens de saída…
35,675Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)76.98sTempo de resposta (máx.)144.07sTempo de resposta (total)230.93sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.1Pontuação média em todos os testes de benchmark.…
3.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)10.73sTempo de resposta (máx.)10.73sTempo de resposta (total)10.73sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.73sTempo de resposta (médio)…
516Total de tokens de entrada…
120Tokens de saída…
3,898Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)9.20sTempo de resposta (máx.)9.20sTempo de resposta (total)9.20sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.41sTempo de resposta (máx.)10.36sTempo de resposta (total)18.82sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.41sTempo de resposta (médio)…
699Total de tokens de entrada…
97Tokens de saída…
7,838Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.54sTempo de resposta (máx.)2.67sTempo de resposta (total)5.07sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.1Pontuação média em todos os testes de benchmark.…
5.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
77.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Resposta incorreta: 1Tempo de resposta (médio)10.79sTempo de resposta (máx.)16.74sTempo de resposta (total)32.37sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.79sTempo de resposta (médio)…
696Total de tokens de entrada…
369Tokens de saída…
10,474Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
8.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)12.62sTempo de resposta (máx.)29.62sTempo de resposta (total)37.85sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.72sTempo de resposta (máx.)5.72sTempo de resposta (total)5.72sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.72sTempo de resposta (médio)…
8,193Total de tokens de entrada…
309Tokens de saída…
1,436Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)17.70sTempo de resposta (máx.)17.70sTempo de resposta (total)17.70sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
17.70sTempo de resposta (médio)…
204Total de tokens de entrada…
24Tokens de saída…
7,615Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)11.29sTempo de resposta (máx.)11.29sTempo de resposta (total)11.29sUm teste é totalmente aprovado apenas quando todas as execuções passam.…