Navegação
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Qwen3.6 35B A3B (medium) vs Step 3.7 Flash (high)

Step 3.7 Flash (high) lidera na pontuação média com 6.6 vs 6.5. Qwen3.6 35B A3B (medium) tem menor custo de benchmark com $0.812 vs $1.350. Qwen3.6 35B A3B (medium) é mais rápido com 59.92s vs 72.72s, com taxas de acerto de 58.0% vs 58.0%.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-10-01

Modelos comparados

Posição
#193
Total de tokens de saída
776,174
Tempo de resposta (médio)
59.92s
Custo total
$0.812
Posição
#190
Total de tokens de saída
1,100,052
Tempo de resposta (médio)
72.72s
Custo total
$1.350
Modelo recomendado Qwen3.6 35B A3B (medium)

A pontuação fica perto da melhor aqui (6.5 vs 6.6) e custa cerca de 1.7x menos que Step 3.7 Flash (high).

Comparação detalhada

Métrica Qwen3.6 35B A3B Qwen3.6 35B A3B medium Lançamento: 2026-04-20 Step 3.7 Flash Step 3.7 Flash high Lançamento: 2026-05-29
Pontuação 6.5 6.6
Posição #193 #190
Confiabilidade 10.0 10.0
Consistência 9.0 8.5
Tentativas 69/69 69/69
Testes corretos
Taxa de acerto por tentativa 58.0% 58.0%
Testes instáveis 3 4
Execuções totais 69 69
Custo por resultado 6.732 12.267
Custo total $0.812 $1.350
Preço de entrada $0.150 / 1M $0.200 / 1M
Preço de saída $1.000 / 1M $1.150 / 1M
Total de tokens de entrada 282,192 421,200
Tokens de saída 75,306 1,100,052
Tokens de raciocínio 700,868 0
Tempo de resposta (médio) 59.92s 72.72s
Tempo de resposta (máx.) 817.57s 364.99s
Tempo de resposta (total) 1258.32s 1672.53s
Parâmetros 35B no total (3B ativos) 198B no total (11B ativos)
Disponibilidade Código aberto Código aberto

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#193 Qwen3.6 35B A3B

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Custo
$0.000
Tempo
300.0s
Tokens
0 tok

#190 Step 3.7 Flash

high
Custo
$0.007
Tempo
63.6s
Tokens
6,030 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Qwen3.6 35B A3B 7.7 10.0 66.7% 0 50.55s 5,051 7,929 37,223
Step 3.7 Flash 4.0 6.0 22.2% 1 206.21s 6,057 327,340 0

Comparação rápida

Trocar par de comparação