Navegação
Advertise here

DeepSeek V4 Flash 0731 (medium) vs Qwen3.5 Plus 2026-04-20 (medium)

DeepSeek V4 Flash 0731 (medium) lidera na pontuação média com 7.3 vs 7.2. DeepSeek V4 Flash 0731 (medium) tem menor custo de benchmark com $0.066 vs $0.323. Qwen3.5 Plus 2026-04-20 (medium) é mais rápido com 46.97s vs 84.66s, com taxas de acerto de 71.2% vs 63.6%.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-09-08

Modelos comparados

Posição
#122
Total de tokens de saída
550,855
Tempo de resposta (médio)
84.66s
Custo total
$0.066
Posição
#127
Total de tokens de saída
172,123
Tempo de resposta (médio)
46.97s
Custo total
$0.323
Modelo recomendado DeepSeek V4 Flash 0731 (medium)

Tem a melhor pontuação aqui (7.3) e custa cerca de 4.9x menos que Qwen3.5 Plus 2026-04-20 (medium).

Comparação detalhada

Métrica DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 medium Lançamento: 2026-08-01 Qwen3.5 Plus 2026-04-20 Qwen3.5 Plus 2026-04-20 medium Lançamento: 2026-04-20
Pontuação 7.3 7.2
Posição #122 #127
Confiabilidade 10.0 9.6
Consistência 7.1 9.0
Tentativas 66/66 66/66
Testes corretos
Taxa de acerto por tentativa 71.2% 63.6%
Testes instáveis 8 2
Execuções totais 66 66
Custo por resultado 0.960 3.048
Custo total $0.066 $0.323
Preço de entrada $0.065 / 1M $0.300 / 1M
Preço de saída $0.180 / 1M $1.800 / 1M
Total de tokens de entrada 89,819 42,106
Tokens de saída 58,398 2,280
Tokens de raciocínio 492,457 169,843
Tempo de resposta (médio) 84.66s 46.97s
Tempo de resposta (máx.) 288.78s 189.38s
Tempo de resposta (total) 1862.46s 986.35s
Parâmetros 284B no total (13B ativos) ~397B no total (~17B ativos)
Disponibilidade Código fechado Código fechado

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#122 DeepSeek V4 Flash 0731

medium
Custo
$0.004
Tempo
93.3s
Tokens
13,252 tok

#127 Qwen3.5 Plus 2026-04-20

medium
Custo
$0.008
Tempo
76.7s
Tokens
4,355 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
DeepSeek V4 Flash 0731 6.4 4.4 77.8% 2 198.78s 6,032 4,109 160,154
Qwen3.5 Plus 2026-04-20 6.2 8.7 33.3% 0 125.25s 7,630 308 58,682

Comparação rápida

Trocar par de comparação