Navegação
Advertise here

gpt-oss-120b (medium) vs GLM 5.3 FlashX (low)

GLM 5.3 FlashX (low) lidera na pontuação média com 6.0 vs 5.9. gpt-oss-120b (medium) tem menor custo de benchmark com $0.030 vs $0.157. GLM 5.3 FlashX (low) é mais rápido com 9.69s vs 31.58s, com taxas de acerto de 47.8% vs 63.8%.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-10-01

Modelos comparados

Posição
#243
Total de tokens de saída
118,831
Tempo de resposta (médio)
31.58s
Custo total
$0.030
Posição
#238
Total de tokens de saída
43,203
Tempo de resposta (médio)
9.69s
Custo total
$0.157
Modelo recomendado gpt-oss-120b (medium)

A pontuação fica perto da melhor aqui (5.9 vs 6.0) e custa cerca de 5.4x menos que GLM 5.3 FlashX (low).

Comparação detalhada

Métrica gpt-oss-120b gpt-oss-120b medium Lançamento: 2025-08-05 GLM 5.3 FlashX GLM 5.3 FlashX low Lançamento: 2026-09-21
Pontuação 5.9 6.0
Posição #243 #238
Confiabilidade 10.0 10.0
Consistência 8.1 6.8
Tentativas 69/69 69/69
Testes corretos
Taxa de acerto por tentativa 47.8% 63.8%
Testes instáveis 5 9
Execuções totais 69 69
Custo por resultado 0.335 1.423
Custo total $0.030 $0.157
Preço de entrada $0.037 / 1M $0.370 / 1M
Preço de saída $0.170 / 1M $1.250 / 1M
Total de tokens de entrada 285,293 277,028
Tokens de saída 29,565 11,965
Tokens de raciocínio 89,266 31,238
Tempo de resposta (médio) 31.58s 9.69s
Tempo de resposta (máx.) 203.90s 77.99s
Tempo de resposta (total) 536.78s 222.83s
Parâmetros 117B no total (5.1B ativos) 320B no total (18B ativos)
Disponibilidade Código aberto Código fechado

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#243 gpt-oss-120b

medium
Custo
$0.001
Tempo
26.7s
Tokens
555 tok

#238 GLM 5.3 FlashX

low
Custo
$0.002
Tempo
8.4s
Tokens
1,526 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973
GLM 5.3 FlashX 5.5 7.4 44.4% 1 5.45s 7,317 382 4,760

Comparação rápida

Trocar par de comparação