Qwen3.8 27B (high) lidera na pontuação média com 8.7 vs 8.6. Claude Haiku 5.5 (low) tem menor custo de benchmark com $0.061 vs ~$0.298. Claude Haiku 5.5 (low) é mais rápido com 7.51s vs 166.34s, com taxas de acerto de 76.8% vs 78.3%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-10-07
Modelos comparados
Posição
#64
Total de tokens de saída
61,650
Tempo de resposta (médio)
7.51s
Custo total
$0.061
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
Posição
#56
Total de tokens de saída
677,080
Tempo de resposta (médio)
166.34s
Custo total
~$0.298A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Modelo recomendadoClaude Haiku 5.5 (low)
A pontuação fica perto da melhor aqui (8.6 vs 8.7) e custa cerca de 4.9x menos que Qwen3.8 27B (high).
Qwen3.8 27BQwen3.8 27BhighAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.Lançamento: 2026-08-14Disponível grátis
Qwen3.8 27BQwen3.8 27BhighAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.Lançamento: 2026-08-14Disponível grátis
Pontuação
8.6Pontuação média em todos os testes de benchmark.…
8.7Pontuação média em todos os testes de benchmark.…
Posição
#64
#56
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
9.7Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
8.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
9.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 2Sem resposta: 2Resposta incorreta: 2Tempo de resposta (médio)166.34sTempo de resposta (máx.)640.85sTempo de resposta (total)3825.81sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Taxa de acerto por tentativa
76.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
78.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
3Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
69Execuções totais…
69Execuções totais…
Custo por resultado
0.378
~1.751A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Custo total
$0.061
~$0.298A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Preço de entrada
$0.100 / 1MPreço de entrada…
N/DPreço de entrada…
Preço de saída
$0.500 / 1MPreço de saída…
N/DPreço de saída…
Preço de leitura do cache
$0.010 / 1MPreço de leitura do cache…
N/DPreço de leitura do cache…
Preço de escrita no cache
$0.125 / 1MPreço de escrita no cache…
N/DPreço de escrita no cache…
Total de tokens de entrada
296,301Total de tokens de entrada…
348,967Total de tokens de entrada…
Tokens de saída
10,672Tokens de saída…
1,005Tokens de saída…
Tokens de raciocínio
50,978Tokens de raciocínio…
676,075Tokens de raciocínio…
Tempo de resposta (médio)
7.51sTempo de resposta (médio)…
166.34sTempo de resposta (médio)…
Tempo de resposta (máx.)
44.43sTempo de resposta (máx.)…
640.85sTempo de resposta (máx.)…
Tempo de resposta (total)
172.74sTempo de resposta (total)…
3825.81sTempo de resposta (total)…
Parâmetros
~50B
27.3B
Disponibilidade
Código fechado
Pesos disponíveis
Os preços de cache aplicam-se aos tokens de entrada. A leitura reutiliza prompts em cache; a escrita armazena-os e pode custar mais. Os tokens de saída usam o preço de saída.
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#64 Claude Haiku 5.5
low
Custo
$0.001
Tempo
7.4s
Tokens
1,851 tok
#56 Qwen3.8 27B
highAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
Custo
~$0.008A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)44.43sTempo de resposta (máx.)44.43sTempo de resposta (total)44.43sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
44.43sTempo de resposta (médio)…
153,966Total de tokens de entrada…
2,991Tokens de saída…
3,811Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)132.27sTempo de resposta (máx.)132.27sTempo de resposta (total)132.27sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.7Pontuação média em todos os testes de benchmark.…
7.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
91.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)2.16sTempo de resposta (máx.)3.03sTempo de resposta (total)8.62sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.16sTempo de resposta (médio)…
858Total de tokens de entrada…
483Tokens de saída…
1,480Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.10sTempo de resposta (máx.)21.48sTempo de resposta (total)32.40sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.9Pontuação média em todos os testes de benchmark.…
7.5A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
77.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)7.30sTempo de resposta (máx.)8.92sTempo de resposta (total)21.89sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.30sTempo de resposta (médio)…
10,608Total de tokens de entrada…
531Tokens de saída…
11,618Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
8.1Pontuação média em todos os testes de benchmark.…
7.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
88.9%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)248.62sTempo de resposta (máx.)458.25sTempo de resposta (total)745.85sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.94sTempo de resposta (máx.)27.39sTempo de resposta (total)47.88sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
23.94sTempo de resposta (médio)…
104,796Total de tokens de entrada…
4,741Tokens de saída…
19,543Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)185.57sTempo de resposta (máx.)333.21sTempo de resposta (total)371.15sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.45sTempo de resposta (máx.)3.70sTempo de resposta (total)6.89sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.45sTempo de resposta (médio)…
10,515Total de tokens de entrada…
312Tokens de saída…
1,609Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)34.85sTempo de resposta (máx.)57.71sTempo de resposta (total)69.71sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.9Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
55.6%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Resposta incorreta: 1Tempo de resposta (médio)7.35sTempo de resposta (máx.)7.77sTempo de resposta (total)22.06sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.35sTempo de resposta (médio)…
990Total de tokens de entrada…
64Tokens de saída…
9,207Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Resposta incorreta: 1Tempo de resposta (médio)526.74sTempo de resposta (máx.)640.85sTempo de resposta (total)1580.21sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.6Pontuação média em todos os testes de benchmark.…
9.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.38sTempo de resposta (máx.)1.38sTempo de resposta (total)1.38sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.38sTempo de resposta (médio)…
714Total de tokens de entrada…
319Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)8.45sTempo de resposta (máx.)8.45sTempo de resposta (total)8.45sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.20sTempo de resposta (máx.)3.24sTempo de resposta (total)4.40sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.20sTempo de resposta (médio)…
921Total de tokens de entrada…
94Tokens de saída…
515Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.24sTempo de resposta (máx.)10.18sTempo de resposta (total)16.49sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)2.76sTempo de resposta (máx.)3.28sTempo de resposta (total)8.28sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.76sTempo de resposta (médio)…
912Total de tokens de entrada…
611Tokens de saída…
1,783Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
7.6Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
77.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)199.90sTempo de resposta (máx.)569.33sTempo de resposta (total)599.69sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.19sTempo de resposta (máx.)4.19sTempo de resposta (total)4.19sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.19sTempo de resposta (médio)…
11,757Total de tokens de entrada…
354Tokens de saída…
459Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.62sTempo de resposta (máx.)5.62sTempo de resposta (total)5.62sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)2.70sTempo de resposta (máx.)2.70sTempo de resposta (total)2.70sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.70sTempo de resposta (médio)…
264Total de tokens de entrada…
172Tokens de saída…
953Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)263.98sTempo de resposta (máx.)263.98sTempo de resposta (total)263.98sUm teste é totalmente aprovado apenas quando todas as execuções passam.…