A pontuação média está praticamente empatada em 8.4 vs 8.4. GPT-6 Sol (low) tem menor custo de benchmark com $0.273 vs ~$0.287. GPT-6 Sol (low) é mais rápido com 6.92s vs 167.89s, com taxas de acerto de 86.4% vs 77.3%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-09-23
Modelos comparados
Posição
#68
Total de tokens de saída
11,677
Tempo de resposta (médio)
6.92s
Custo total
$0.273
As respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
Posição
#65
Total de tokens de saída
656,635
Tempo de resposta (médio)
167.89s
Custo total
~$0.287A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Modelo recomendadoGPT-6 Sol (low)
Tem a melhor pontuação aqui (8.4) e responde cerca de 24.3x mais rápido que Qwen3.8 27B (high).
Qwen3.8 27BQwen3.8 27BhighAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
Qwen3.8 27BQwen3.8 27BhighAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.Lançamento: 2026-08-14
Pontuação
8.4Pontuação média em todos os testes de benchmark.…
8.4Pontuação média em todos os testes de benchmark.…
Posição
#68
#65
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
9.6Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
8.5A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
9.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Tentativas
66/66
66/66
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 5Tempo de resposta (médio)6.92sTempo de resposta (máx.)17.91sTempo de resposta (total)152.17sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 2Sem resposta: 2Resposta incorreta: 2Tempo de resposta (médio)167.89sTempo de resposta (máx.)640.85sTempo de resposta (total)3693.54sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Taxa de acerto por tentativa
86.4%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
77.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
4Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
66Execuções totais…
66Execuções totais…
Custo por resultado
1.604
~1.792A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Custo total
$0.273
~$0.287A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Preço de entrada
$2.000 / 1MPreço de entrada…
N/DPreço de entrada…
Preço de saída
$10.000 / 1MPreço de saída…
N/DPreço de saída…
Total de tokens de entrada
77,882Total de tokens de entrada…
100,179Total de tokens de entrada…
Tokens de saída
4,047Tokens de saída…
904Tokens de saída…
Tokens de raciocínio
7,630Tokens de raciocínio…
655,731Tokens de raciocínio…
Tempo de resposta (médio)
6.92sTempo de resposta (médio)…
167.89sTempo de resposta (médio)…
Tempo de resposta (máx.)
17.91sTempo de resposta (máx.)…
640.85sTempo de resposta (máx.)…
Tempo de resposta (total)
152.17sTempo de resposta (total)…
3693.54sTempo de resposta (total)…
Parâmetros
~2T no total (~150B ativos)
27.3B
Disponibilidade
Código fechado
Pesos disponíveis
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#68 GPT-6 Sol
low
Custo
$0.018
Tempo
17.4s
Tokens
1,850 tok
#65 Qwen3.8 27B
highAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
Custo
~$0.008A estimativa inclui apenas a eletricidade da GPU. Exclui o resto do computador e a aquisição do hardware. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.43sTempo de resposta (máx.)3.18sTempo de resposta (total)9.74sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.43sTempo de resposta (médio)…
606Total de tokens de entrada…
172Tokens de saída…
339Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.10sTempo de resposta (máx.)21.48sTempo de resposta (total)32.40sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.2Pontuação média em todos os testes de benchmark.…
4.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)8.74sTempo de resposta (máx.)16.82sTempo de resposta (total)26.23sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.74sTempo de resposta (médio)…
7,302Total de tokens de entrada…
405Tokens de saída…
1,296Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
8.1Pontuação média em todos os testes de benchmark.…
7.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
88.9%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)248.62sTempo de resposta (máx.)458.25sTempo de resposta (total)745.85sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.13sTempo de resposta (máx.)9.76sTempo de resposta (total)16.26sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.13sTempo de resposta (médio)…
54,674Total de tokens de entrada…
2,524Tokens de saída…
512Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)185.57sTempo de resposta (máx.)333.21sTempo de resposta (total)371.15sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.63sTempo de resposta (máx.)14.86sTempo de resposta (total)27.26sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
13.63sTempo de resposta (médio)…
7,140Total de tokens de entrada…
224Tokens de saída…
17Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)34.85sTempo de resposta (máx.)57.71sTempo de resposta (total)69.71sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.3Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
44.4%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)11.45sTempo de resposta (máx.)16.44sTempo de resposta (total)34.36sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
11.45sTempo de resposta (médio)…
732Total de tokens de entrada…
71Tokens de saída…
4,573Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Resposta incorreta: 1Tempo de resposta (médio)526.74sTempo de resposta (máx.)640.85sTempo de resposta (total)1580.21sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)17.91sTempo de resposta (máx.)17.91sTempo de resposta (total)17.91sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
17.91sTempo de resposta (médio)…
477Total de tokens de entrada…
83Tokens de saída…
0Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)8.45sTempo de resposta (máx.)8.45sTempo de resposta (total)8.45sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.37sTempo de resposta (máx.)2.57sTempo de resposta (total)4.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.37sTempo de resposta (médio)…
660Total de tokens de entrada…
93Tokens de saída…
185Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.24sTempo de resposta (máx.)10.18sTempo de resposta (total)16.49sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.66sTempo de resposta (máx.)3.06sTempo de resposta (total)7.97sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.66sTempo de resposta (médio)…
642Total de tokens de entrada…
209Tokens de saída…
314Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
7.6Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
77.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)199.90sTempo de resposta (máx.)569.33sTempo de resposta (total)599.69sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.03sTempo de resposta (máx.)4.03sTempo de resposta (total)4.03sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.03sTempo de resposta (médio)…
5,454Total de tokens de entrada…
236Tokens de saída…
16Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.62sTempo de resposta (máx.)5.62sTempo de resposta (total)5.62sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.7Pontuação média em todos os testes de benchmark.…
1.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.67sTempo de resposta (máx.)3.67sTempo de resposta (total)3.67sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.67sTempo de resposta (médio)…
195Total de tokens de entrada…
30Tokens de saída…
378Tokens de raciocínio…
Qwen3.8 27BAs respostas do modelo candidato foram geradas em hardware local. O OpenRouter foi usado apenas para avaliação.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)263.98sTempo de resposta (máx.)263.98sTempo de resposta (total)263.98sUm teste é totalmente aprovado apenas quando todas as execuções passam.…