A pontuação média está praticamente empatada em 5.4 vs 5.3. GPT-5.6 Luna tem menor custo de benchmark com $0.042 vs $0.786. GPT-5.6 Luna é mais rápido com 3.78s vs 22.65s, com taxas de acerto de 43.5% vs 34.8%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-10-07
Modelos comparados
Posição
#295
Total de tokens de saída
11,832
Tempo de resposta (médio)
22.65s
Custo total
$0.786
Posição
#297
Total de tokens de saída
8,000
Tempo de resposta (médio)
3.78s
Custo total
$0.042
Modelo recomendadoGPT-5.6 Luna
Tem a melhor pontuação aqui (5.3) e custa cerca de 18.9x menos que Ember-1.
5.4Pontuação média em todos os testes de benchmark.…
5.3Pontuação média em todos os testes de benchmark.…
Posição
#295
#297
Confiabilidade
8.8Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
8.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
8.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Tentativas
69/69
69/69
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 10Erro de API: 5Tempo de resposta (médio)22.65sTempo de resposta (máx.)93.12sTempo de resposta (total)520.91sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 15Formatação extra: 1Chamada de ferramenta inválida: 1Tempo de resposta (médio)3.78sTempo de resposta (máx.)53.77sTempo de resposta (total)86.83sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Taxa de acerto por tentativa
43.5%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
34.8%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
4Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
3Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
69Execuções totais…
69Execuções totais…
Custo por resultado
9.817
2.814
Custo total
$0.786
$0.042
Preço de entrada
$3.000 / 1MPreço de entrada…
$0.200 / 1MPreço de entrada…
Preço de saída
$15.000 / 1MPreço de saída…
$1.200 / 1MPreço de saída…
Preço de leitura do cache
$0.300 / 1MPreço de leitura do cache…
$0.020 / 1MPreço de leitura do cache…
Preço de escrita no cache
N/DPreço de escrita no cache…
$0.250 / 1MPreço de escrita no cache…
Total de tokens de entrada
202,617Total de tokens de entrada…
230,744Total de tokens de entrada…
Tokens de saída
11,832Tokens de saída…
8,000Tokens de saída…
Tokens de raciocínio
0Tokens de raciocínio…
0Tokens de raciocínio…
Tempo de resposta (médio)
22.65sTempo de resposta (médio)…
3.78sTempo de resposta (médio)…
Tempo de resposta (máx.)
93.12sTempo de resposta (máx.)…
53.77sTempo de resposta (máx.)…
Tempo de resposta (total)
520.91sTempo de resposta (total)…
86.83sTempo de resposta (total)…
Parâmetros
~2.8T no total (~104B ativos)
~400B no total (~17B ativos)
Disponibilidade
Código fechado
Código fechado
Os preços de cache aplicam-se aos tokens de entrada. A leitura reutiliza prompts em cache; a escrita armazena-os e pode custar mais. Os tokens de saída usam o preço de saída.
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
6.1Pontuação média em todos os testes de benchmark.…
3.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)92.87sTempo de resposta (máx.)92.87sTempo de resposta (total)92.87sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)53.77sTempo de resposta (máx.)53.77sTempo de resposta (total)53.77sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.2Pontuação média em todos os testes de benchmark.…
7.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
41.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Erro de API: 1Tempo de resposta (médio)22.37sTempo de resposta (máx.)65.56sTempo de resposta (total)89.48sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
25.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)901msTempo de resposta (máx.)1.45sTempo de resposta (total)3.60sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)1.94sTempo de resposta (máx.)3.25sTempo de resposta (total)5.81sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.8Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
22.2%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)980msTempo de resposta (máx.)1.57sTempo de resposta (total)2.94sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Resposta incorreta: 1Tempo de resposta (médio)49.01sTempo de resposta (máx.)93.12sTempo de resposta (total)98.01sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.2Pontuação média em todos os testes de benchmark.…
9.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Resposta incorreta: 1Tempo de resposta (médio)6.68sTempo de resposta (máx.)10.57sTempo de resposta (total)13.35sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.4Pontuação média em todos os testes de benchmark.…
5.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)35.25sTempo de resposta (máx.)68.56sTempo de resposta (total)70.50sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)758msTempo de resposta (máx.)803msTempo de resposta (total)1.52sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)21.61sTempo de resposta (máx.)60.47sTempo de resposta (total)64.83sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.6Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
22.2%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)784msTempo de resposta (máx.)855msTempo de resposta (total)2.35sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)2.28sTempo de resposta (máx.)2.28sTempo de resposta (total)2.28sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.00sTempo de resposta (máx.)1.00sTempo de resposta (total)1.00sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.4Pontuação média em todos os testes de benchmark.…
5.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)31.00sTempo de resposta (máx.)59.73sTempo de resposta (total)62.01sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.1Pontuação média em todos os testes de benchmark.…
5.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
83.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.23sTempo de resposta (máx.)1.66sTempo de resposta (total)2.47sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.54sTempo de resposta (máx.)4.51sTempo de resposta (total)7.63sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Resposta incorreta: 1Tempo de resposta (médio)790msTempo de resposta (máx.)865msTempo de resposta (total)2.37sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)26.44sTempo de resposta (máx.)26.44sTempo de resposta (total)26.44sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.80sTempo de resposta (máx.)2.80sTempo de resposta (total)2.80sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.05sTempo de resposta (máx.)1.05sTempo de resposta (total)1.05sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)651msTempo de resposta (máx.)651msTempo de resposta (total)651msUm teste é totalmente aprovado apenas quando todas as execuções passam.…