Navegação
AI BENCHY
Advertise here

Modelos comparados

Comparação benchmark Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium): Gemini 3 Flash Preview (medium) lidera em Pontuação com 9.6. Grok 4.1 Fast (medium) lidera em Confiabilidade com 10.0. Grok 4.1 Fast (medium) tem o menor Custo total em $0.069. Grok 4.20 Multi Agent Beta (medium) é o mais rápido com 9.69s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-07-28

Posição
#147
Total de tokens de saída
93,212
Tempo de resposta (médio)
9.75s
Custo total
$0.750
Posição
#203
Total de tokens de saída
600,042
Tempo de resposta (médio)
9.69s
Custo total
$5.599
Posição
#207
Total de tokens de saída
98,340
Tempo de resposta (médio)
23.85s
Custo total
$0.069
Posição
#3
Total de tokens de saída
232,650
Tempo de resposta (médio)
19.20s
Custo total
$0.742
Modelo recomendado Gemini 3 Flash Preview (medium)

Tem a melhor pontuação aqui (9.6) e custa cerca de 2.9x menos que os outros modelos nesta comparação.

Comparação detalhada

Métrica Grok 4.20 Beta Grok 4.20 Beta medium Lançamento: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lançamento: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Lançamento: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Lançamento: 2025-12-17
Pontuação 6.0 4.8 4.7 9.6
Posição #147 #203 #207 #3
Confiabilidade N/D N/D 10.0 10.0
Consistência 7.8 6.4 6.3 9.7
Testes corretos
Taxa de acerto por tentativa 66.7% 48.5% 53.0% 98.5%
Testes instáveis 1 5 6 1
Execuções totais 52 52 57 66
Custo por resultado 4.505 62.923 0.642 3.533
Custo total $0.750 $5.599 $0.069 $0.742
Preço de entrada $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Preço de saída $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Total de tokens de entrada 35,955 721,952 42,845 87,861
Tokens de saída 1,647 294,668 2,006 5,486
Tokens de raciocínio 91,565 305,374 96,334 227,164
Tempo de resposta (médio) 9.75s 9.69s 23.85s 19.20s
Tempo de resposta (máx.) 31.36s 35.28s 121.79s 117.26s
Tempo de resposta (total) 175.48s 155.07s 286.16s 422.42s

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#147 Grok 4.20 Beta

medium
Custo
$0.034
Tempo
91.0s
Tokens
13,523 tok

#203 Grok 4.20 Multi Agent Beta

medium
Custo
$0.261
Tempo
123.4s
Tokens
199,344 tok

#207 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Custo
$0.000
Tempo
0.1s
Tokens
0 tok

#3 Gemini 3 Flash Preview

medium
Custo
$0.010
Tempo
18.4s
Tokens
3,351 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 3.3 3.3 33.3% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 7.8 4.0 11.1% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084

Comparação rápida

Trocar par de comparação