Navegação
AI BENCHY
Your ad here

AI BENCHY Compare

Qwen: Qwen3 Coder Next vs xAI: Grok 4.20 Multi-Agent Beta

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-12

Métrica Qwen3 Coder Next Qwen3 Coder Next none Lançamento: 2026-02-03 Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lançamento: 2026-03-12
Posição #56 #47
Pontuação média 4.0 4.9
Consistência 10.0 7.1
Custo por resultado 0.174 97.178
Custo total $0.007 $4.859
Testes corretos
Taxa de acerto por tentativa 25.0% 52.1%
Testes instáveis 0 6
Execuções totais 48 48
Tokens de saída 3,026 293,634
Tokens de raciocínio 0 291,260
Tempo de resposta (médio) 11.68s 9.08s
Tempo de resposta (máx.) 45.14s 35.28s
Tempo de resposta (total) 116.76s 127.09s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação média vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação média vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Qwen3 Coder Next 2.3 10.0 0.0% 0 4.39s 1,315 0
Grok 4.20 Multi-Agent Beta 4.0 4.4 66.7% 2 3.77s 28,392 27,808
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Qwen3 Coder Next 10.0 10.0 0.0% 0 45.14s 317 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Qwen3 Coder Next 5.4 10.0 50.0% 0 1.32s 246 0
Grok 4.20 Multi-Agent Beta 9.9 10.0 100.0% 0 5.54s 25,306 25,051
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Qwen3 Coder Next 4.0 10.0 33.3% 0 962ms 26 0
Grok 4.20 Multi-Agent Beta 10.0 7.2 11.1% 1 24.67s 164,609 163,647
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Qwen3 Coder Next 10.0 10.0 100.0% 0 1.34s 152 0
Grok 4.20 Multi-Agent Beta 4.0 2.8 66.7% 1 6.40s 15,848 15,746
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Qwen3 Coder Next 4.5 10.0 0.0% 0 7.71s 63 0
Grok 4.20 Multi-Agent Beta 9.0 10.0 50.0% 0 4.63s 25,457 25,322
Puzzle Solving Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Qwen3 Coder Next 1.3 10.0 0.0% 0 22.86s 652 0
Grok 4.20 Multi-Agent Beta 6.3 5.1 77.8% 2 5.01s 34,022 33,686
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Qwen3 Coder Next 10.0 10.0 100.0% 0 2.47s 255 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0

Comparação rápida

Trocar par de comparação