Navegação
AI BENCHY
Your ad here

AI BENCHY Compare

OpenAI: GPT-4o-mini vs xAI: Grok 4.20 Multi-Agent Beta

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-12

Métrica GPT-4o-mini GPT-4o-mini none Lançamento: 2024-07-18 Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lançamento: 2026-03-12
Posição #55 #47
Pontuação média 4.0 4.9
Consistência 10.0 7.1
Custo por resultado 0.114 97.178
Custo total $0.005 $4.859
Testes corretos
Taxa de acerto por tentativa 25.0% 52.1%
Testes instáveis 0 6
Execuções totais 48 48
Tokens de saída 1,594 293,634
Tokens de raciocínio 0 291,260
Tempo de resposta (médio) 2.07s 9.08s
Tempo de resposta (máx.) 7.58s 35.28s
Tempo de resposta (total) 18.60s 127.09s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação média vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação média vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-4o-mini 4.0 10.0 33.3% 0 1.83s 180 0
Grok 4.20 Multi-Agent Beta 4.0 4.4 66.7% 2 3.77s 28,392 27,808
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-4o-mini 10.0 10.0 0.0% 0 7.58s 568 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-4o-mini 9.9 10.0 100.0% 0 1.27s 183 0
Grok 4.20 Multi-Agent Beta 9.9 10.0 100.0% 0 5.54s 25,306 25,051
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-4o-mini 10.0 10.0 0.0% 0 637ms 15 0
Grok 4.20 Multi-Agent Beta 10.0 7.2 11.1% 1 24.67s 164,609 163,647
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-4o-mini 3.0 10.0 0.0% 0 909ms 66 0
Grok 4.20 Multi-Agent Beta 4.0 2.8 66.7% 1 6.40s 15,848 15,746
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-4o-mini 4.5 10.0 0.0% 0 1.27s 69 0
Grok 4.20 Multi-Agent Beta 9.0 10.0 50.0% 0 4.63s 25,457 25,322
Puzzle Solving Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-4o-mini 2.3 10.0 0.0% 0 1.30s 308 0
Grok 4.20 Multi-Agent Beta 6.3 5.1 77.8% 2 5.01s 34,022 33,686
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
GPT-4o-mini 10.0 10.0 100.0% 0 2.51s 205 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0

Comparação rápida

Trocar par de comparação