A pontuação média está praticamente empatada em 7.6 vs 7.6. Qwen3.8 Flash Next (medium) tem menor custo de benchmark com ~$0.047 vs ~$0.089. Qwen3.8 Flash Next (medium) é mais rápido com 24.79s vs 46.60s, com taxas de acerto de 68.1% vs 75.4%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-10-05
Modelos comparados
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
Posição
#121
Total de tokens de saída
209,143
Tempo de resposta (médio)
46.60s
Custo total
~$0.089A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
Posição
#119
Total de tokens de saída
143,965
Tempo de resposta (médio)
24.79s
Custo total
~$0.047A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.4752 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.046984.
Modelo recomendadoQwen3.8 Flash Next (medium)
Tem a melhor pontuação aqui (7.6) e custa cerca de 1.9x menos que Qwen3.8 27B (low).
Comparação detalhada
Métrica
Qwen3.8 27BQwen3.8 27BlowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.Lançamento: 2026-08-14Disponível grátis
Qwen3.8 Flash NextQwen3.8 Flash NextmediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.Lançamento: 2026-10-04
Métrica
Qwen3.8 27BQwen3.8 27BlowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.Lançamento: 2026-08-14Disponível grátis
Qwen3.8 Flash NextQwen3.8 Flash NextmediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.Lançamento: 2026-10-04
Pontuação
7.6Pontuação média em todos os testes de benchmark.…
7.6Pontuação média em todos os testes de benchmark.…
Posição
#121
#119
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
9.7A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
7.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Tentativas
69/69
69/69
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 5Sem resposta: 2Não seguiu as instruções: 1Tempo de resposta (médio)46.60sTempo de resposta (máx.)376.04sTempo de resposta (total)1071.83sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 6Não seguiu as instruções: 1Sem resposta: 1Tempo de resposta (médio)24.79sTempo de resposta (máx.)159.62sTempo de resposta (total)570.26sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Taxa de acerto por tentativa
68.1%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
75.4%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
6Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
69Execuções totais…
69Execuções totais…
Custo por resultado
~0.589A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
~0.314A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.4752 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.046984.
Custo total
~$0.089A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
~$0.047A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.4752 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.046984.
Preço de entrada
N/DPreço de entrada…
N/DPreço de entrada…
Preço de saída
N/DPreço de saída…
N/DPreço de saída…
Preço de leitura do cache
N/DPreço de leitura do cache…
N/DPreço de leitura do cache…
Preço de escrita no cache
N/DPreço de escrita no cache…
N/DPreço de escrita no cache…
Total de tokens de entrada
315,290Total de tokens de entrada…
278,792Total de tokens de entrada…
Tokens de saída
1,607Tokens de saída…
1,695Tokens de saída…
Tokens de raciocínio
207,536Tokens de raciocínio…
142,270Tokens de raciocínio…
Tempo de resposta (médio)
46.60sTempo de resposta (médio)…
24.79sTempo de resposta (médio)…
Tempo de resposta (máx.)
376.04sTempo de resposta (máx.)…
159.62sTempo de resposta (máx.)…
Tempo de resposta (total)
1071.83sTempo de resposta (total)…
570.26sTempo de resposta (total)…
Parâmetros
27.3B
180B no total (6B ativos)
Disponibilidade
Pesos disponíveis
Pesos disponíveis
Os preços de cache aplicam-se aos tokens de entrada. A leitura reutiliza prompts em cache; a escrita armazena-os e pode custar mais. Os tokens de saída usam o preço de saída.
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#121 Qwen3.8 27B
lowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
Custo
~$0.003A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
Tempo
92.8s
Tokens
6,902 tok
#119 Qwen3.8 Flash Next
mediumAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
Custo
~$0.002A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0113 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001119.
Tempo
40.7s
Tokens
4,059 tok
Posição
-
Custo
-
Tempo
-
Tokens
-
Melhores modelos por pontuação
Pontuação vs custo total
Tempo de resposta (médio)
Pontuação vs Tempo de resposta (médio)
Total de tokens de saída
Pontuação vs Total de tokens de saída
Detalhamento por categoria
Tarefas de agentes
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
6.1Pontuação média em todos os testes de benchmark.…
3.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)211.32sTempo de resposta (máx.)211.32sTempo de resposta (total)211.32sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
211.32sTempo de resposta (médio)…
215,585Total de tokens de entrada…
62Tokens de saída…
39,752Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
4.7Pontuação média em todos os testes de benchmark.…
3.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)159.62sTempo de resposta (máx.)159.62sTempo de resposta (total)159.62sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
159.62sTempo de resposta (médio)…
140,688Total de tokens de entrada…
51Tokens de saída…
35,597Tokens de raciocínio…
Truques anti-IA
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.02sTempo de resposta (máx.)5.68sTempo de resposta (total)12.07sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.02sTempo de resposta (médio)…
984Total de tokens de entrada…
183Tokens de saída…
2,016Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.81sTempo de resposta (máx.)2.74sTempo de resposta (total)7.24sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.81sTempo de resposta (médio)…
672Total de tokens de entrada…
273Tokens de saída…
1,804Tokens de raciocínio…
Programação
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)140.92sTempo de resposta (máx.)376.04sTempo de resposta (total)422.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
140.92sTempo de resposta (médio)…
8,127Total de tokens de entrada…
585Tokens de saída…
86,694Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)45.53sTempo de resposta (máx.)98.91sTempo de resposta (total)136.59sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
45.53sTempo de resposta (médio)…
7,893Total de tokens de entrada…
346Tokens de saída…
37,643Tokens de raciocínio…
Combinado
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)90.63sTempo de resposta (máx.)143.71sTempo de resposta (total)181.27sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
90.63sTempo de resposta (médio)…
69,687Total de tokens de entrada…
66Tokens de saída…
37,791Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
6.4Pontuação média em todos os testes de benchmark.…
5.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)76.72sTempo de resposta (máx.)116.08sTempo de resposta (total)153.43sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
76.72sTempo de resposta (médio)…
110,480Total de tokens de entrada…
49Tokens de saída…
36,248Tokens de raciocínio…
Análise e extração de dados
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.03sTempo de resposta (máx.)9.09sTempo de resposta (total)16.06sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.03sTempo de resposta (médio)…
9,087Total de tokens de entrada…
150Tokens de saída…
1,962Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.65sTempo de resposta (máx.)7.50sTempo de resposta (total)13.31sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.65sTempo de resposta (médio)…
8,097Total de tokens de entrada…
267Tokens de saída…
3,274Tokens de raciocínio…
Específico do domínio
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)60.78sTempo de resposta (máx.)120.94sTempo de resposta (total)182.34sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
60.78sTempo de resposta (médio)…
1,014Total de tokens de entrada…
12Tokens de saída…
31,872Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
2.9Pontuação média em todos os testes de benchmark.…
4.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
22.2%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)17.29sTempo de resposta (máx.)18.55sTempo de resposta (total)51.86sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
17.29sTempo de resposta (médio)…
780Total de tokens de entrada…
10Tokens de saída…
15,480Tokens de raciocínio…
Inteligência geral
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)5.37sTempo de resposta (máx.)5.37sTempo de resposta (total)5.37sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.37sTempo de resposta (médio)…
594Total de tokens de entrada…
132Tokens de saída…
729Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
4.8Pontuação média em todos os testes de benchmark.…
3.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)7.29sTempo de resposta (máx.)7.29sTempo de resposta (total)7.29sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.29sTempo de resposta (médio)…
516Total de tokens de entrada…
152Tokens de saída…
1,553Tokens de raciocínio…
Seguimento de instruções
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.43sTempo de resposta (máx.)2.87sTempo de resposta (total)4.86sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.43sTempo de resposta (médio)…
855Total de tokens de entrada…
48Tokens de saída…
915Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.04sTempo de resposta (máx.)2.85sTempo de resposta (total)4.09sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.04sTempo de resposta (médio)…
699Total de tokens de entrada…
48Tokens de saída…
1,071Tokens de raciocínio…
Resolução de quebra-cabeças
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.91sTempo de resposta (máx.)8.81sTempo de resposta (total)14.74sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.91sTempo de resposta (médio)…
930Total de tokens de entrada…
240Tokens de saída…
2,382Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
8.2Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
88.9%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)2.23sTempo de resposta (máx.)2.98sTempo de resposta (total)6.69sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.23sTempo de resposta (médio)…
696Total de tokens de entrada…
469Tokens de saída…
1,471Tokens de raciocínio…
Chamada de ferramentas
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)8.42sTempo de resposta (máx.)8.42sTempo de resposta (total)8.42sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.42sTempo de resposta (médio)…
8,145Total de tokens de entrada…
15Tokens de saída…
1,350Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.75sTempo de resposta (máx.)5.75sTempo de resposta (total)5.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.75sTempo de resposta (médio)…
8,067Total de tokens de entrada…
24Tokens de saída…
744Tokens de raciocínio…
Conhecimentos gerais
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8:latest · Q4_K_M · Ollama 0.32.12 · NVIDIA GeForce RTX 3090.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)12.64sTempo de resposta (máx.)12.64sTempo de resposta (total)12.64sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
12.64sTempo de resposta (médio)…
282Total de tokens de entrada…
114Tokens de saída…
2,073Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)24.39sTempo de resposta (máx.)24.39sTempo de resposta (total)24.39sUm teste é totalmente aprovado apenas quando todas as execuções passam.…