Navegação
AI BENCHY
Your ad here

AI BENCHY Compare

StepFun: Step 3.5 Flash vs Z.ai: GLM 5

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-04-16

Métrica Step 3.5 Flash Step 3.5 Flash medium Lançamento: 2026-02-01 GLM 5 GLM 5 none Lançamento: 2026-02-12
Pontuação 7.9 6.6
Posição #30 #52
Consistência 9.1 9.6
Testes corretos
Taxa de acerto por tentativa 70.6% 51.9%
Testes instáveis 2 1
Execuções totais 49 54
Custo por resultado 0.000 0.217
Custo total $0.000 $0.020
Preço de entrada $0.100 / 1M $0.720 / 1M
Preço de saída $0.300 / 1M $2.300 / 1M
Tokens de saída 71,904 1,959
Tokens de raciocínio 155,607 0
Tempo de resposta (médio) 26.78s 4.23s
Tempo de resposta (máx.) 170.45s 11.07s
Tempo de resposta (total) 294.58s 46.51s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 10.0 10.0 100.0% 0 13.56s 14,376 17,668
GLM 5 4.8 10.0 25.0% 0 2.37s 275 0
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 1,176 12,984
GLM 5 3.0 10.0 0.0% 0 4.98s 406 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 600 13,886
GLM 5 10.0 10.0 100.0% 0 5.78s 203 0
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 5.3 7.2 44.4% 1 170.45s 45,350 90,436
GLM 5 3.0 10.0 0.0% 0 2.24s 19 0
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 5.5 10.0 0.0% 0 6.54s 2,214 2,584
GLM 5 10.0 10.0 100.0% 0 3.27s 103 0
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 8.5 6.8 83.3% 1 4.98s 2,284 3,412
GLM 5 10.0 10.0 100.0% 0 1.48s 61 0
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 5.3 10.0 33.3% 0 7.72s 5,629 10,835
GLM 5 7.7 10.0 66.7% 0 2.05s 264 0
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 275 3,802
GLM 5 10.0 10.0 100.0% 0 11.07s 220 0
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash - - - - - - - -
GLM 5 5.6 3.5 33.3% 1 8.84s 408 0

Comparação rápida

Trocar par de comparação