Navegação
AI BENCHY
Advertise here

Modelos comparados

Comparação benchmark Nemotron 3 Super (medium) vs Qwen3.5-122B-A10B (medium) vs Elephant Alpha (medium) vs gpt-oss-120b (medium): Qwen3.5-122B-A10B (medium) lidera em Pontuação com 7.1. Qwen3.5-122B-A10B (medium) lidera em Confiabilidade com 10.0. Elephant Alpha (medium) tem o menor Custo total em $0.000. Elephant Alpha (medium) é o mais rápido com 1.27s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-09-04

Posição
#217
Total de tokens de saída
115,574
Tempo de resposta (médio)
52.31s
Custo total
$0.050
Posição
#127
Total de tokens de saída
487,519
Tempo de resposta (médio)
65.67s
Custo total
$1.207
Posição
#295
Total de tokens de saída
2,596
Tempo de resposta (médio)
1.27s
Custo total
$0.000
Posição
#189
Total de tokens de saída
98,282
Tempo de resposta (médio)
20.81s
Custo total
$0.020
Modelo recomendado gpt-oss-120b (medium)

Oferece o melhor compromisso geral: pontuação competitiva (6.1), custo menor que os outros modelos nesta comparação e tempo de resposta equilibrado.

Comparação detalhada

Métrica Nemotron 3 Super Nemotron 3 Super medium Lançamento: 2026-03-11 Disponível grátis Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium Lançamento: 2026-02-24 Elephant Alpha Elephant Alpha medium Lançamento: 2026-04-14 gpt-oss-120b gpt-oss-120b medium Lançamento: 2025-08-05
Pontuação 5.7 7.1 4.3 6.1
Posição #217 #127 #295 #189
Confiabilidade 9.1 10.0 N/D 10.0
Consistência 8.9 8.5 9.2 8.0
Tentativas 66/66 66/66 63/66 66/66
Testes corretos
Taxa de acerto por tentativa 40.9% 71.2% 28.8% 50.0%
Testes instáveis 3 4 1 5
Execuções totais 66 66 63 66
Custo por resultado 0.004 8.446 0.000 0.224
Custo total $0.050 $1.207 $0.000 $0.020
Preço de entrada $0.085 / 1M $0.290 / 1M $0.000 / 1M $0.037 / 1M
Preço de saída $0.400 / 1M $2.400 / 1M $0.000 / 1M $0.170 / 1M
Total de tokens de entrada 81,438 124,780 33,744 108,767
Tokens de saída 17,674 47,694 2,596 29,378
Tokens de raciocínio 97,900 439,825 0 68,904
Tempo de resposta (médio) 52.31s 65.67s 1.27s 20.81s
Tempo de resposta (máx.) 431.98s 519.30s 3.70s 68.16s
Tempo de resposta (total) 1046.21s 1444.68s 22.82s 332.88s
Parâmetros 120B no total (12B ativos) 122B no total (10B ativos) 104B no total (7.4B ativos) 117B no total (5.1B ativos)
Disponibilidade Pesos disponíveis Código aberto Código aberto Código aberto

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#217 Nemotron 3 Super

medium
Custo
$0.000
Tempo
272.6s
Tokens
5,296 tok

#127 Qwen3.5-122B-A10B

medium
Custo
$0.019
Tempo
48.7s
Tokens
6,034 tok

#295 Elephant Alpha

medium
Elephant Alpha was a stealth model revealed on April 21st as Ling-2.6-flash. Find it here: https://openrouter.ai/inclusionai/ling-2.6-flash:free
Custo
$0.000
Tempo
0.1s
Tokens
0 tok

#189 gpt-oss-120b

medium
Custo
$0.001
Tempo
26.7s
Tokens
555 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Nemotron 3 Super 3.1 10.0 0.0% 0 147.32s 2,275 797 4,424
Qwen3.5-122B-A10B 6.0 7.2 55.6% 1 114.48s 7,630 8,057 82,578
Elephant Alpha 3.7 7.8 11.1% 1 1.30s 813 365 0
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

Comparação rápida

Trocar par de comparação