Navegação
Advertise here

Mistral Large 4 (low) vs Qwen3.7 Flash (low)

Qwen3.7 Flash (low) lidera na pontuação média com 7.7 vs 7.6. Qwen3.7 Flash (low) tem menor custo de benchmark com $0.071 vs $1.648. Qwen3.7 Flash (low) é mais rápido com 41.03s vs 300.15s, com taxas de acerto de 65.2% vs 68.1%.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-10-06

Modelos comparados

Posição
#119
Total de tokens de saída
714,287
Tempo de resposta (médio)
300.15s
Custo total
$1.648
Posição
#117
Total de tokens de saída
331,107
Tempo de resposta (médio)
41.03s
Custo total
$0.071
Modelo recomendado Qwen3.7 Flash (low)

Tem a melhor pontuação aqui (7.7) e custa cerca de 23.4x menos que Mistral Large 4 (low).

Comparação detalhada

Métrica Mistral Large 4 Mistral Large 4 low Lançamento: 2026-10-06 Qwen3.7 Flash Qwen3.7 Flash low Lançamento: 2026-07-28
Pontuação 7.6 7.7
Posição #119 #117
Confiabilidade 9.0 10.0
Consistência 8.7 8.1
Tentativas 69/69 69/69
Testes corretos
Taxa de acerto por tentativa 65.2% 68.1%
Testes instáveis 4 6
Execuções totais 69 69
Custo por resultado 12.670 0.439
Custo total $1.648 $0.071
Preço de entrada $0.680 / 1M $0.030 / 1M
Preço de saída $2.090 / 1M $0.130 / 1M
Preço de leitura do cache $0.070 / 1M $0.006 / 1M
Preço de escrita no cache N/D $0.039 / 1M
Total de tokens de entrada 226,734 318,058
Tokens de saída 278,013 16,035
Tokens de raciocínio 638,296 315,072
Tempo de resposta (médio) 300.15s 41.03s
Tempo de resposta (máx.) 1798.01s 394.54s
Tempo de resposta (total) 6903.40s 943.75s
Parâmetros 1.05T no total (49B ativos) ~35B no total (~3B ativos)
Disponibilidade Código fechado Código fechado

Os preços de cache aplicam-se aos tokens de entrada. A leitura reutiliza prompts em cache; a escrita armazena-os e pode custar mais. Os tokens de saída usam o preço de saída.

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#119 Mistral Large 4

low
Custo
$0.015
Tempo
115.1s
Tokens
6,915 tok

#117 Qwen3.7 Flash

low
Reached the allocated time limit (600 seconds) without receiving showcase output.
Custo
$0.000
Tempo
600.0s
Tokens
0 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mistral Large 4 3.4 7.2 22.2% 1 1379.72s 5,896 129,426 386,126
Qwen3.7 Flash 6.7 7.8 55.6% 1 42.36s 7,893 428 56,419

Comparação rápida

Trocar par de comparação