low lidera na pontuação média com 8.0 vs 7.1. low tem menor custo de benchmark com ~$0.045 vs ~$0.195. low é mais rápido com 23.66s vs 102.66s, com taxas de acerto de 79.7% vs 72.5%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-10-05
Modelos comparados
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
Posição
#96
Total de tokens de saída
135,295
Tempo de resposta (médio)
23.66s
Custo total
~$0.045A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.4535 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.044834.
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
Posição
#154
Total de tokens de saída
621,056
Tempo de resposta (médio)
102.66s
Custo total
~$0.195A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 1.9676 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.194534.
Modelo recomendadolow
Tem a melhor pontuação aqui (8.0) e custa cerca de 4.3x menos que Qwen3.8 Flash Next (xhigh).
Comparação detalhada
Métrica
Qwen3.8 Flash NextQwen3.8 Flash NextlowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.Lançamento: 2026-10-04
Qwen3.8 Flash NextQwen3.8 Flash NextxhighAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.Lançamento: 2026-10-04
Métrica
Qwen3.8 Flash NextQwen3.8 Flash NextlowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.Lançamento: 2026-10-04
Qwen3.8 Flash NextQwen3.8 Flash NextxhighAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.Lançamento: 2026-10-04
Pontuação
8.0Pontuação média em todos os testes de benchmark.…
7.1Pontuação média em todos os testes de benchmark.…
Posição
#96
#154
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
9.9Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
8.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
7.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
79.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
72.5%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
6Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
6Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
69Execuções totais…
69Execuções totais…
Custo por resultado
~0.299A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.4535 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.044834.
~1.390A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 1.9676 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.194534.
Custo total
~$0.045A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.4535 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.044834.
~$0.195A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 1.9676 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.194534.
Preço de entrada
N/DPreço de entrada…
N/DPreço de entrada…
Preço de saída
N/DPreço de saída…
N/DPreço de saída…
Preço de leitura do cache
N/DPreço de leitura do cache…
N/DPreço de leitura do cache…
Preço de escrita no cache
N/DPreço de escrita no cache…
N/DPreço de escrita no cache…
Total de tokens de entrada
342,163Total de tokens de entrada…
301,749Total de tokens de entrada…
Tokens de saída
1,518Tokens de saída…
1,033Tokens de saída…
Tokens de raciocínio
133,777Tokens de raciocínio…
620,023Tokens de raciocínio…
Tempo de resposta (médio)
23.66sTempo de resposta (médio)…
102.66sTempo de resposta (médio)…
Tempo de resposta (máx.)
166.72sTempo de resposta (máx.)…
674.08sTempo de resposta (máx.)…
Tempo de resposta (total)
544.16sTempo de resposta (total)…
2361.10sTempo de resposta (total)…
Parâmetros
180B no total (6B ativos)
180B no total (6B ativos)
Disponibilidade
Pesos disponíveis
Pesos disponíveis
Os preços de cache aplicam-se aos tokens de entrada. A leitura reutiliza prompts em cache; a escrita armazena-os e pode custar mais. Os tokens de saída usam o preço de saída.
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#96 Qwen3.8 Flash Next
lowAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
Custo
~$0.002A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0131 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001295.
Tempo
47.2s
Tokens
5,270 tok
#154 Qwen3.8 Flash Next
xhighAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
Custo
~$0.010A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0925 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009149.
Tempo
333.1s
Tokens
30,654 tok
Posição
-
Custo
-
Tempo
-
Tokens
-
Melhores modelos por pontuação
Pontuação vs custo total
Tempo de resposta (médio)
Pontuação vs Tempo de resposta (médio)
Total de tokens de saída
Pontuação vs Total de tokens de saída
Detalhamento por categoria
Tarefas de agentes
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
6.1Pontuação média em todos os testes de benchmark.…
3.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)137.50sTempo de resposta (máx.)137.50sTempo de resposta (total)137.50sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
137.50sTempo de resposta (médio)…
194,811Total de tokens de entrada…
72Tokens de saída…
28,519Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
4.7Pontuação média em todos os testes de benchmark.…
3.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)173.66sTempo de resposta (máx.)173.66sTempo de resposta (total)173.66sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
173.66sTempo de resposta (médio)…
148,808Total de tokens de entrada…
26Tokens de saída…
38,616Tokens de raciocínio…
Truques anti-IA
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.03sTempo de resposta (máx.)2.72sTempo de resposta (total)8.13sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.03sTempo de resposta (médio)…
984Total de tokens de entrada…
233Tokens de saída…
1,773Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.73sTempo de resposta (máx.)18.55sTempo de resposta (total)26.91sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.73sTempo de resposta (médio)…
1,128Total de tokens de entrada…
184Tokens de saída…
7,283Tokens de raciocínio…
Programação
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)29.46sTempo de resposta (máx.)49.90sTempo de resposta (total)88.39sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
29.46sTempo de resposta (médio)…
8,127Total de tokens de entrada…
397Tokens de saída…
24,147Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
7.4Pontuação média em todos os testes de benchmark.…
7.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
77.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)192.20sTempo de resposta (máx.)370.86sTempo de resposta (total)576.59sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
192.20sTempo de resposta (médio)…
8,235Total de tokens de entrada…
122Tokens de saída…
186,070Tokens de raciocínio…
Combinado
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
6.9Pontuação média em todos os testes de benchmark.…
5.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)98.91sTempo de resposta (máx.)166.72sTempo de resposta (total)197.82sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
98.91sTempo de resposta (médio)…
118,012Total de tokens de entrada…
60Tokens de saída…
51,088Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
7.3Pontuação média em todos os testes de benchmark.…
5.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
83.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)92.24sTempo de resposta (máx.)143.77sTempo de resposta (total)184.49sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
92.24sTempo de resposta (médio)…
122,809Total de tokens de entrada…
52Tokens de saída…
43,355Tokens de raciocínio…
Análise e extração de dados
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.20sTempo de resposta (máx.)6.23sTempo de resposta (total)12.40sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.20sTempo de resposta (médio)…
8,253Total de tokens de entrada…
267Tokens de saída…
2,783Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.24sTempo de resposta (máx.)9.63sTempo de resposta (total)18.48sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.24sTempo de resposta (médio)…
8,325Total de tokens de entrada…
212Tokens de saída…
3,925Tokens de raciocínio…
Específico do domínio
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
4.1Pontuação média em todos os testes de benchmark.…
4.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
44.5%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)23.34sTempo de resposta (máx.)42.75sTempo de resposta (total)70.03sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
23.34sTempo de resposta (médio)…
1,014Total de tokens de entrada…
12Tokens de saída…
18,966Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
3.5Pontuação média em todos os testes de benchmark.…
4.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)326.96sTempo de resposta (máx.)674.08sTempo de resposta (total)980.89sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
326.96sTempo de resposta (médio)…
1,122Total de tokens de entrada…
11Tokens de saída…
239,950Tokens de raciocínio…
Inteligência geral
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
4.7Pontuação média em todos os testes de benchmark.…
3.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)5.00sTempo de resposta (máx.)5.00sTempo de resposta (total)5.00sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.00sTempo de resposta (médio)…
594Total de tokens de entrada…
130Tokens de saída…
1,171Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
4.7Pontuação média em todos os testes de benchmark.…
3.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)3.95sTempo de resposta (máx.)3.95sTempo de resposta (total)3.95sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.95sTempo de resposta (médio)…
630Total de tokens de entrada…
82Tokens de saída…
864Tokens de raciocínio…
Seguimento de instruções
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.32sTempo de resposta (máx.)3.23sTempo de resposta (total)4.64sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.32sTempo de resposta (médio)…
855Total de tokens de entrada…
48Tokens de saída…
1,050Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.72sTempo de resposta (máx.)3.99sTempo de resposta (total)7.44sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.72sTempo de resposta (médio)…
927Total de tokens de entrada…
42Tokens de saída…
1,939Tokens de raciocínio…
Resolução de quebra-cabeças
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
8.7Pontuação média em todos os testes de benchmark.…
7.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
88.9%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)1.72sTempo de resposta (máx.)2.26sTempo de resposta (total)5.15sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.72sTempo de resposta (médio)…
930Total de tokens de entrada…
272Tokens de saída…
1,001Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)19.51sTempo de resposta (máx.)39.77sTempo de resposta (total)58.54sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
19.51sTempo de resposta (médio)…
1,038Total de tokens de entrada…
275Tokens de saída…
15,050Tokens de raciocínio…
Chamada de ferramentas
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.85sTempo de resposta (máx.)5.85sTempo de resposta (total)5.85sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.85sTempo de resposta (médio)…
8,301Total de tokens de entrada…
21Tokens de saída…
816Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.11sTempo de resposta (máx.)5.11sTempo de resposta (total)5.11sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.11sTempo de resposta (médio)…
8,409Total de tokens de entrada…
21Tokens de saída…
650Tokens de raciocínio…
Conhecimentos gerais
Pontuação
Consistência
Taxa de acerto por tentativa
Testes instáveis
Testes corretos
Tempo de resposta (médio)
Tokens de entrada
Tokens de saída
Tokens de raciocínio
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)9.26sTempo de resposta (máx.)9.26sTempo de resposta (total)9.26sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.26sTempo de resposta (médio)…
282Total de tokens de entrada…
6Tokens de saída…
2,463Tokens de raciocínio…
Qwen3.8 Flash NextAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação. qwen3.8-flash-next-iq3_s · IQ3_S · Strata 0.1.39 · NVIDIA GeForce RTX 3090.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)325.04sTempo de resposta (máx.)325.04sTempo de resposta (total)325.04sUm teste é totalmente aprovado apenas quando todas as execuções passam.…