A pontuação média está praticamente empatada em 7.2 vs 7.2. Qwen3.8 27B (medium) tem menor custo de benchmark com ~$0.073 vs $0.116. Qwen3.5-27B é mais rápido com 9.98s vs 40.09s, com taxas de acerto de 47.8% vs 66.7%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-10-09
Modelos comparados
Posição
#149
Total de tokens de saída
36,422
Tempo de resposta (médio)
9.98s
Custo total
$0.116
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
Posição
#151
Total de tokens de saída
170,696
Tempo de resposta (médio)
40.09s
Custo total
~$0.073A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Modelo recomendadoQwen3.5-27B
Tem a melhor pontuação aqui (7.2) e responde cerca de 4.0x mais rápido que Qwen3.8 27B (medium).
Qwen3.8 27BQwen3.8 27BmediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.Lançamento: 2026-08-14Disponível grátis
Qwen3.8 27BQwen3.8 27BmediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.Lançamento: 2026-08-14Disponível grátis
Pontuação
7.2Pontuação média em todos os testes de benchmark.…
7.2Pontuação média em todos os testes de benchmark.…
Posição
#149
#151
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
9.7Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
9.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
9.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Tentativas
69/69
69/69
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 11Não seguiu as instruções: 2Tempo de resposta (médio)9.98sTempo de resposta (máx.)124.53sTempo de resposta (total)229.52sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
47.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
69Execuções totais…
69Execuções totais…
Custo por resultado
1.153
~0.520A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Custo total
$0.116
~$0.073A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Preço de entrada
$0.195 / 1MPreço de entrada…
N/DPreço de entrada…
Preço de saída
$1.560 / 1MPreço de saída…
N/DPreço de saída…
Preço de leitura do cache
N/DPreço de leitura do cache…
N/DPreço de leitura do cache…
Preço de escrita no cache
N/DPreço de escrita no cache…
N/DPreço de escrita no cache…
Total de tokens de entrada
283,977Total de tokens de entrada…
277,164Total de tokens de entrada…
Tokens de saída
36,422Tokens de saída…
1,913Tokens de saída…
Tokens de raciocínio
0Tokens de raciocínio…
168,783Tokens de raciocínio…
Tempo de resposta (médio)
9.98sTempo de resposta (médio)…
40.09sTempo de resposta (médio)…
Tempo de resposta (máx.)
124.53sTempo de resposta (máx.)…
214.63sTempo de resposta (máx.)…
Tempo de resposta (total)
229.52sTempo de resposta (total)…
881.89sTempo de resposta (total)…
Parâmetros
27B
27.3B
Disponibilidade
Código aberto
Pesos disponíveis
Os preços de cache aplicam-se aos tokens de entrada. A leitura reutiliza prompts em cache; a escrita armazena-os e pode custar mais. Os tokens de saída usam o preço de saída.
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#149 Qwen3.5-27B
none
Custo
$0.007
Tempo
42.9s
Tokens
4,273 tok
#151 Qwen3.8 27B
mediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
Custo
~$0.002A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)124.53sTempo de resposta (máx.)124.53sTempo de resposta (total)124.53sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
124.53sTempo de resposta (médio)…
181,652Total de tokens de entrada…
12,099Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
4.7Pontuação média em todos os testes de benchmark.…
1.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)187.85sTempo de resposta (máx.)187.85sTempo de resposta (total)187.85sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
25.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)788msTempo de resposta (máx.)1.34sTempo de resposta (total)3.15sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
788msTempo de resposta (médio)…
696Total de tokens de entrada…
267Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.93sTempo de resposta (máx.)5.18sTempo de resposta (total)11.70sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)1.80sTempo de resposta (máx.)2.51sTempo de resposta (total)5.40sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.80sTempo de resposta (médio)…
7,913Total de tokens de entrada…
415Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)40.50sTempo de resposta (máx.)72.14sTempo de resposta (total)121.51sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.4Pontuação média em todos os testes de benchmark.…
5.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)39.43sTempo de resposta (máx.)69.46sTempo de resposta (total)78.86sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
39.43sTempo de resposta (médio)…
74,756Total de tokens de entrada…
22,190Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
8.7Pontuação média em todos os testes de benchmark.…
6.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
83.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)124.48sTempo de resposta (máx.)214.63sTempo de resposta (total)248.96sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.43sTempo de resposta (máx.)1.45sTempo de resposta (total)2.86sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.43sTempo de resposta (médio)…
7,794Total de tokens de entrada…
243Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)8.76sTempo de resposta (máx.)10.36sTempo de resposta (total)17.53sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)634msTempo de resposta (máx.)784msTempo de resposta (total)1.90sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
634msTempo de resposta (médio)…
798Total de tokens de entrada…
17Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)76.98sTempo de resposta (máx.)144.07sTempo de resposta (total)230.93sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)2.51sTempo de resposta (máx.)2.51sTempo de resposta (total)2.51sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.51sTempo de resposta (médio)…
522Total de tokens de entrada…
126Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)9.20sTempo de resposta (máx.)9.20sTempo de resposta (total)9.20sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.03sTempo de resposta (máx.)1.40sTempo de resposta (total)2.06sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.03sTempo de resposta (médio)…
711Total de tokens de entrada…
69Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.54sTempo de resposta (máx.)2.67sTempo de resposta (total)5.07sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.7Pontuação média em todos os testes de benchmark.…
7.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
55.6%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Resposta incorreta: 1Tempo de resposta (médio)1.38sTempo de resposta (máx.)2.24sTempo de resposta (total)4.13sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.38sTempo de resposta (médio)…
714Total de tokens de entrada…
683Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
8.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)12.62sTempo de resposta (máx.)29.62sTempo de resposta (total)37.85sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.54sTempo de resposta (máx.)3.54sTempo de resposta (total)3.54sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.54sTempo de resposta (médio)…
8,211Total de tokens de entrada…
303Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)599msTempo de resposta (máx.)599msTempo de resposta (total)599msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
599msTempo de resposta (médio)…
210Total de tokens de entrada…
10Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)11.29sTempo de resposta (máx.)11.29sTempo de resposta (total)11.29sUm teste é totalmente aprovado apenas quando todas as execuções passam.…