Navegação
AI BENCHY
Advertise here

AI BENCHY Compare

Google: Gemini 3.5 Flash vs xAI: Grok 4.20

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-05-22

Métrica Gemini 3.5 Flash Gemini 3.5 Flash low Lançamento: 2026-05-19 Grok 4.20 Grok 4.20 none Lançamento: 2026-03-31
Pontuação 9.3 5.4
Posição #3 #120
Confiabilidade 10.0 N/D
Consistência 10.0 9.5
Testes corretos
Taxa de acerto por tentativa 90.0% 35.2%
Testes instáveis 0 1
Execuções totais 60 54
Custo por resultado 1.582 1.574
Custo total $0.285 $0.095
Preço de entrada $1.500 / 1M $1.250 / 1M
Preço de saída $9.000 / 1M $2.500 / 1M
Tokens de saída 2,027 1,967
Tokens de raciocínio 23,938 0
Tempo de resposta (médio) 2.98s 1.11s
Tempo de resposta (máx.) 6.44s 6.04s
Tempo de resposta (total) 59.59s 20.02s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.52s 209 2,536
Grok 4.20 4.8 10.0 25.0% 0 501ms 267 0
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 6.8 10.0 50.0% 0 5.54s 452 6,839
Grok 4.20 3.4 9.3 0.0% 0 1.22s 312 0
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 10.0 10.0 100.0% 0 6.44s 351 3,050
Grok 4.20 3.0 10.0 0.0% 0 6.04s 282 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 10.0 10.0 100.0% 0 1.81s 279 1,164
Grok 4.20 10.0 10.0 100.0% 0 522ms 207 0
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 7.7 10.0 66.7% 0 3.39s 12 4,538
Grok 4.20 3.0 10.0 0.0% 0 687ms 325 0
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.27s 119 916
Grok 4.20 4.8 10.0 0.0% 0 659ms 83 0
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 9.9 10.0 100.0% 0 1.86s 71 1,652
Grok 4.20 6.3 10.0 50.0% 0 455ms 60 0
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.35s 288 2,150
Grok 4.20 5.3 7.2 44.4% 1 487ms 242 0
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 10.0 10.0 100.0% 0 3.27s 234 403
Grok 4.20 10.0 10.0 100.0% 0 4.63s 189 0
Conhecimentos gerais Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Gemini 3.5 Flash 10.0 10.0 100.0% 0 1.88s 12 690
Grok 4.20 - - - - - - - -

Comparação rápida

Trocar par de comparação