Navegação
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modelos comparados

Comparação benchmark Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium): Gemini 3 Flash Preview (medium) lidera em Pontuação com 9.5. Grok 4.1 Fast (medium) lidera em Confiabilidade com 10.0. Grok 4.1 Fast (medium) tem o menor Custo total em $0.069. Grok 4.20 Multi Agent Beta (medium) é o mais rápido com 9.69s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-09-10

Modelos comparados

Posição
#210
Total de tokens de saída
93,212
Tempo de resposta (médio)
9.75s
Custo total
$0.750
Posição
#289
Total de tokens de saída
600,042
Tempo de resposta (médio)
9.69s
Custo total
$5.599
Posição
#294
Total de tokens de saída
98,340
Tempo de resposta (médio)
23.85s
Custo total
$0.069
Posição
#10
Total de tokens de saída
239,608
Tempo de resposta (médio)
19.86s
Custo total
$0.763
Modelo recomendado Gemini 3 Flash Preview (medium)

Tem a melhor pontuação aqui (9.5) e custa cerca de 2.8x menos que os outros modelos nesta comparação.

Comparação detalhada

Métrica Grok 4.20 Beta Grok 4.20 Beta medium Lançamento: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lançamento: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Lançamento: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Lançamento: 2025-12-17
Pontuação 6.0 4.8 4.7 9.5
Posição #210 #289 #294 #10
Confiabilidade N/D N/D 10.0 10.0
Consistência 7.8 6.4 6.3 9.7
Tentativas 52/66 52/66 57/66 66/66
Testes corretos
Taxa de acerto por tentativa 66.7% 48.5% 53.0% 93.9%
Testes instáveis 1 5 6 1
Execuções totais 52 52 57 66
Custo por resultado 4.505 62.923 0.642 3.814
Custo total $0.750 $5.599 $0.069 $0.763
Preço de entrada $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Preço de saída $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Total de tokens de entrada 35,955 721,952 42,845 87,870
Tokens de saída 1,647 294,668 2,006 5,486
Tokens de raciocínio 91,565 305,374 96,334 234,122
Tempo de resposta (médio) 9.75s 9.69s 23.85s 19.86s
Tempo de resposta (máx.) 31.36s 35.28s 121.79s 117.26s
Tempo de resposta (total) 175.48s 155.07s 286.16s 436.88s
Parâmetros ~1T no total (~100B ativos) ~1T no total (~100B ativos) ~500B no total (~50B ativos) ~500B no total (~20B ativos)
Disponibilidade Código fechado Código fechado Código fechado Código fechado

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#210 Grok 4.20 Beta

medium
Custo
$0.034
Tempo
91.0s
Tokens
13,523 tok

#289 Grok 4.20 Multi Agent Beta

medium
Custo
$0.261
Tempo
123.4s
Tokens
199,344 tok

#294 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Custo
$0.000
Tempo
0.1s
Tokens
0 tok

#10 Gemini 3 Flash Preview

medium
Custo
$0.010
Tempo
18.4s
Tokens
3,351 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 3.3 3.3 33.3% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 7.8 4.0 11.1% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084

Comparação rápida

Trocar par de comparação