Comparação benchmark Gemini 2.5 Flash vs GLM 5V Turbo: Gemini 2.5 Flash lidera na pontuação média com 6.2 vs 5.9. Gemini 2.5 Flash tem menor custo de benchmark com $0.016 vs $0.052. Gemini 2.5 Flash é mais rápido com 875ms vs 2.99s, com taxas de acerto de 46.0% vs 38.1%.
Modelo recomendado: Gemini 2.5 Flash - Tem a melhor pontuação aqui (6.2) e custa cerca de 3.4x menos que GLM 5V Turbo.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-18
GLM 5V TurboGLM 5V TurbononeModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.Lançamento: 2026-04-01
Pontuação
6.2Pontuação média em todos os testes de benchmark.…
5.9Pontuação média em todos os testes de benchmark.…
Posição
#93
#105
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
9.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 12Tempo de resposta (médio)875msTempo de resposta (máx.)4.39sTempo de resposta (total)18.37sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 11Não seguiu as instruções: 2Tempo de resposta (médio)2.99sTempo de resposta (máx.)6.51sTempo de resposta (total)62.74sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Taxa de acerto por tentativa
46.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
38.1%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
63Execuções totais…
63Execuções totais…
Custo por resultado
0.169Mostra o custo médio por resposta correta no benchmark, em centavos (quanto menor, melhor).…
0.645Mostra o custo médio por resposta correta no benchmark, em centavos (quanto menor, melhor).…
Custo total
$0.016Custo total (preço atual)…
$0.052Custo total (preço atual)…
Preço de entrada
$0.300 / 1MPreço de entrada…
$1.200 / 1MPreço de entrada…
Preço de saída
$2.500 / 1MPreço de saída…
$4.000 / 1MPreço de saída…
Total de tokens de entrada
35,926Total de tokens de entrada…
37,100Total de tokens de entrada…
Tokens de saída
1,770Tokens de saída…
1,766Tokens de saída…
Tokens de raciocínio
0Tokens de raciocínio…
0Tokens de raciocínio…
Tempo de resposta (médio)
875msTempo de resposta (médio)…
2.99sTempo de resposta (médio)…
Tempo de resposta (máx.)
4.39sTempo de resposta (máx.)…
6.51sTempo de resposta (máx.)…
Tempo de resposta (total)
18.37sTempo de resposta (total)…
62.74sTempo de resposta (total)…
Geração showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Tempo de resposta (médio)582msTempo de resposta (máx.)844msTempo de resposta (total)2.33sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
582msTempo de resposta (médio)…
492Total de tokens de entrada…
102Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
4.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
25.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)3.13sTempo de resposta (máx.)5.90sTempo de resposta (total)12.50sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)736msTempo de resposta (máx.)1.16sTempo de resposta (total)2.21sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
736msTempo de resposta (médio)…
8,122Total de tokens de entrada…
483Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
5.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)3.13sTempo de resposta (máx.)5.30sTempo de resposta (total)9.40sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.39sTempo de resposta (máx.)4.39sTempo de resposta (total)4.39sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.39sTempo de resposta (médio)…
12,519Total de tokens de entrada…
366Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)6.51sTempo de resposta (máx.)6.51sTempo de resposta (total)6.51sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)652msTempo de resposta (máx.)660msTempo de resposta (total)1.30sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
652msTempo de resposta (médio)…
7,257Total de tokens de entrada…
279Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.81sTempo de resposta (máx.)5.69sTempo de resposta (total)7.62sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.9Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
55.6%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)495msTempo de resposta (máx.)642msTempo de resposta (total)1.49sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
495msTempo de resposta (médio)…
633Total de tokens de entrada…
12Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)2.09sTempo de resposta (máx.)2.39sTempo de resposta (total)6.26sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)615msTempo de resposta (máx.)615msTempo de resposta (total)615msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
615msTempo de resposta (médio)…
486Total de tokens de entrada…
78Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
4.6Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)2.22sTempo de resposta (máx.)2.22sTempo de resposta (total)2.22sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)590msTempo de resposta (máx.)622msTempo de resposta (total)1.18sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
590msTempo de resposta (médio)…
615Total de tokens de entrada…
72Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.97sTempo de resposta (máx.)2.43sTempo de resposta (total)3.93sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)604msTempo de resposta (máx.)700msTempo de resposta (total)1.81sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
604msTempo de resposta (médio)…
558Total de tokens de entrada…
132Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Resposta incorreta: 1Tempo de resposta (médio)2.40sTempo de resposta (máx.)3.81sTempo de resposta (total)7.21sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.91sTempo de resposta (máx.)1.91sTempo de resposta (total)1.91sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.91sTempo de resposta (médio)…
5,088Total de tokens de entrada…
234Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.86sTempo de resposta (máx.)4.86sTempo de resposta (total)4.86sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.15sTempo de resposta (máx.)1.15sTempo de resposta (total)1.15sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.15sTempo de resposta (médio)…
156Total de tokens de entrada…
12Tokens de saída…
0Tokens de raciocínio…
GLM 5V TurboModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)2.23sTempo de resposta (máx.)2.23sTempo de resposta (total)2.23sUm teste é totalmente aprovado apenas quando todas as execuções passam.…