Navegação
AI BENCHY
Your ad here

AI BENCHY Compare

Nemotron 3 Super 120b A12b vs xAI: Grok 4.20 Multi-Agent Beta

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-12

Métrica Nemotron 3 Super 120b A12b Nemotron 3 Super 120b A12b none Lançamento: 2026-03-11 Disponível grátis Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lançamento: 2026-03-12
Posição #59 #47
Pontuação média 3.4 4.9
Consistência 8.6 7.1
Custo por resultado 0.000 97.178
Custo total $0.000 $4.859
Testes corretos
Taxa de acerto por tentativa 31.3% 52.1%
Testes instáveis 3 6
Execuções totais 48 48
Tokens de saída 4,222 293,634
Tokens de raciocínio 0 291,260
Tempo de resposta (médio) 8.90s 9.08s
Tempo de resposta (máx.) 24.97s 35.28s
Tempo de resposta (total) 142.40s 127.09s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação média vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação média vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Nemotron 3 Super 120b A12b 10.0 10.0 0.0% 0 7.14s 2,171 0
Grok 4.20 Multi-Agent Beta 4.0 4.4 66.7% 2 3.77s 28,392 27,808
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Nemotron 3 Super 120b A12b 10.0 10.0 0.0% 0 19.98s 124 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Nemotron 3 Super 120b A12b 9.9 10.0 100.0% 0 7.92s 249 0
Grok 4.20 Multi-Agent Beta 9.9 10.0 100.0% 0 5.54s 25,306 25,051
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Nemotron 3 Super 120b A12b 10.0 7.2 22.2% 1 6.23s 26 0
Grok 4.20 Multi-Agent Beta 10.0 7.2 11.1% 1 24.67s 164,609 163,647
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Nemotron 3 Super 120b A12b 3.0 9.9 0.0% 0 24.97s 170 0
Grok 4.20 Multi-Agent Beta 4.0 2.8 66.7% 1 6.40s 15,848 15,746
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Nemotron 3 Super 120b A12b 4.5 6.9 33.3% 1 1.50s 66 0
Grok 4.20 Multi-Agent Beta 9.0 10.0 50.0% 0 4.63s 25,457 25,322
Puzzle Solving Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Nemotron 3 Super 120b A12b 4.7 10.0 33.3% 0 7.50s 1,135 0
Grok 4.20 Multi-Agent Beta 6.3 5.1 77.8% 2 5.01s 34,022 33,686
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Nemotron 3 Super 120b A12b 10.0 1.6 66.7% 1 16.00s 281 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0

Comparação rápida

Trocar par de comparação