Navegação
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Inception: Mercury 2 vs xAI: Grok 4.3

Resumo

Comparação benchmark Mercury 2 vs Grok 4.3: Grok 4.3 lidera na pontuação média com 7.7 vs 7.5. Mercury 2 tem menor custo de benchmark com $0.058 vs $0.614. Mercury 2 é mais rápido com 2.24s vs 47.51s, com taxas de acerto de 54.0% vs 71.4%.

Modelo recomendado: Mercury 2 - A pontuação fica perto da melhor aqui (7.5 vs 7.7) e custa cerca de 10.6x menos que Grok 4.3.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-18

Métrica Mercury 2 Mercury 2 medium Lançamento: 2026-02-24 Grok 4.3 Grok 4.3 medium Lançamento: 2026-05-01
Pontuação 7.5 7.7
Posição #44 #37
Confiabilidade 10.0 10.0
Consistência 8.8 8.5
Testes corretos
Taxa de acerto por tentativa 54.0% 71.4%
Testes instáveis 3 4
Execuções totais 63 63
Custo por resultado 0.578 4.724
Custo total $0.058 $0.614
Preço de entrada $0.250 / 1M $1.250 / 1M
Preço de saída $0.750 / 1M $2.500 / 1M
Total de tokens de entrada 35,116 44,472
Tokens de saída 4,048 1,981
Tokens de raciocínio 61,219 221,382
Tempo de resposta (médio) 2.24s 47.51s
Tempo de resposta (máx.) 14.63s 216.69s
Tempo de resposta (total) 44.72s 997.68s

Geração showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#44 Mercury 2

medium
Custo
$0.002
Tempo
2.1s
Tokens
1,702 tok

#37 xAI: Grok 4.3

medium
Custo
$0.009
Tempo
19.0s
Tokens
3,661 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 6.9 9.9 50.0% 0 1.12s 554 2,546 2,609
Grok 4.3 10.0 10.0 100.0% 0 8.83s 2,010 88 8,207
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 10.0 10.0 100.0% 0 3.28s 12,909 268 4,887
Grok 4.3 10.0 10.0 100.0% 0 63.99s 12,909 234 15,301
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 7.3 5.9 83.3% 1 1.11s 6,234 183 1,656
Grok 4.3 10.0 10.0 100.0% 0 18.97s 7,761 180 9,546
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 2.9 7.2 11.1% 1 6.48s 695 41 30,754
Grok 4.3 5.3 7.2 44.4% 1 181.74s 1,764 14 111,300
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 4.8 10.0 0.0% 0 821ms 456 137 542
Grok 4.3 5.4 2.5 66.7% 1 24.70s 825 70 5,020
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 10.0 10.0 100.0% 0 1.07s 340 14 958
Grok 4.3 9.8 10.0 100.0% 0 18.58s 1,362 57 8,713
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 5.4 10.0 33.3% 0 949ms 601 361 2,781
Grok 4.3 5.9 7.2 55.6% 1 22.52s 1,689 128 14,468
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 10.0 10.0 100.0% 0 1.89s 6,080 180 1,956
Grok 4.3 10.0 10.0 100.0% 0 17.66s 7,263 168 4,615
Conhecimentos gerais Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Mercury 2 3.0 10.0 0.0% 0 2.58s 182 22 3,748
Grok 4.3 3.0 10.0 0.0% 0 44.47s 549 14 12,986

Comparação rápida

Trocar par de comparação