Navegação
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

StepFun: Step 3.5 Flash vs Z.ai: GLM 5.1

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-04-29

Métrica Step 3.5 Flash Step 3.5 Flash medium Lançamento: 2026-02-01 GLM 5.1 GLM 5.1 medium Lançamento: 2026-04-07
Pontuação 7.9 7.8
Posição #40 #44
Confiabilidade N/D N/D
Consistência 9.1 8.6
Testes corretos
Taxa de acerto por tentativa 70.6% 75.9%
Testes instáveis 2 3
Execuções totais 49 54
Custo por resultado 0.000 1.674
Custo total $0.000 $0.201
Preço de entrada $0.100 / 1M $1.050 / 1M
Preço de saída $0.300 / 1M $3.500 / 1M
Tokens de saída 71,904 8,005
Tokens de raciocínio 155,607 49,090
Tempo de resposta (médio) 26.78s 24.13s
Tempo de resposta (máx.) 170.45s 118.52s
Tempo de resposta (total) 294.58s 410.25s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 10.0 10.0 100.0% 0 13.56s 14,376 17,668
GLM 5.1 10.0 10.0 100.0% 0 8.31s 401 5,122
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 1,176 12,984
GLM 5.1 9.5 10.0 100.0% 0 43.11s 327 4,206
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 600 13,886
GLM 5.1 10.0 10.0 100.0% 0 9.33s 991 4,552
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 5.3 7.2 44.4% 1 170.45s 45,350 90,436
GLM 5.1 5.3 10.0 33.3% 0 29.77s 969 11,314
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 5.5 10.0 0.0% 0 6.54s 2,214 2,584
GLM 5.1 10.0 10.0 100.0% 0 20.95s 2,875 2,875
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 8.5 6.8 83.3% 1 4.98s 2,284 3,412
GLM 5.1 6.4 5.8 66.7% 1 7.47s 204 1,617
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 5.3 10.0 33.3% 0 7.72s 5,629 10,835
GLM 5.1 8.2 7.2 88.9% 1 23.85s 899 5,627
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 275 3,802
GLM 5.1 3.0 10.0 0.0% 0 0ms 0 0
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Step 3.5 Flash - - - - - - - -
GLM 5.1 4.7 1.6 66.7% 1 118.52s 1,339 13,777

Comparação rápida

Trocar par de comparação