AI BENCHY Compare

Google: Gemma 4 26B A4B vs Grok 4.20 Multi Agent Beta

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-04-04

Métrica	Gemma 4 26B A4B Gemma 4 26B A4B none Lançamento: 2026-04-03	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lançamento: 2026-03-12

Métrica	Gemma 4 26B A4B Gemma 4 26B A4B none Lançamento: 2026-04-03	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lançamento: 2026-03-12
Pontuação	6.3	6.2
Posição	#53	#55
Consistência	9.1	7.2
Testes corretos
Taxa de acerto por tentativa	47.1%	54.9%
Testes instáveis	2	6
Execuções totais	51	51
Custo por resultado	0.068	82.962
Custo total	$0.005	$4.978
Preço de entrada	$0.130 / 1M	$0.000 / 1M
Preço de saída	$0.400 / 1M	$0.000 / 1M
Tokens de saída	1,335	298,948
Tokens de raciocínio	0	296,529
Tempo de resposta (médio)	6.56s	8.64s
Tempo de resposta (máx.)	57.10s	35.28s
Tempo de resposta (total)	111.54s	129.64s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 26B A4B	8.3	10.0	75.0%	0		1.28s	230	0
Grok 4.20 Multi Agent Beta	6.9	5.8	75.0%	2		3.46s	33,706	33,077

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 26B A4B	3.0	10.0	0.0%	0		30.53s	309	0
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 26B A4B	10.0	10.0	100.0%	0		1.70s	285	0
Grok 4.20 Multi Agent Beta	10.0	10.0	100.0%	0		5.54s	25,306	25,051

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 26B A4B	3.6	7.2	22.2%	1		2.49s	27	0
Grok 4.20 Multi Agent Beta	2.9	7.2	11.1%	1		24.67s	164,609	163,647

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 26B A4B	4.0	10.0	0.0%	0		3.54s	85	0
Grok 4.20 Multi Agent Beta	5.8	2.8	66.7%	1		6.40s	15,848	15,746

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 26B A4B	4.4	6.9	16.7%	1		1.08s	75	0
Grok 4.20 Multi Agent Beta	8.3	10.0	50.0%	0		4.63s	25,457	25,322

Puzzle Solving	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 26B A4B	5.7	10.0	33.3%	0		739ms	114	0
Grok 4.20 Multi Agent Beta	7.2	5.1	77.8%	2		5.01s	34,022	33,686

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 26B A4B	10.0	10.0	100.0%	0		57.10s	210	0
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0

Comparação rápida

Trocar par de comparação

Gemma 4 26B A4BnonevsGPT-5 Nanomedium Gemma 4 26B A4BnonevsMercury 2medium DeepSeek V3.2nonevsGrok 4.20 Multi Agent Betamedium Qwen3.5-FlashnonevsGrok 4.20 Multi Agent Betamedium Grok 4.20 Multi Agent BetamediumvsMiMo-V2-Omninone Grok 4.20 Multi Agent BetamediumvsGLM 5V Turbonone Seed-2.0-LitenonevsGrok 4.20 Multi Agent Betamedium Gemma 4 26B A4Bnonevsgpt-oss-120bmediumDisponível grátis Gemini 2.5 FlashnonevsGrok 4.20 Multi Agent Betamedium Qwen3.5-35B-A3BnonevsGrok 4.20 Multi Agent Betamedium Hunter AlphanonevsGrok 4.20 Multi Agent Betamedium Gemma 4 26B A4BnonevsMiniMax M2.5mediumDisponível grátis