AI BENCHY Compare

Google: Gemma 4 31B vs Inception: Mercury 2

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-05-29

Métrica	Gemma 4 31B Gemma 4 31B none Lançamento: 2026-04-02 Disponível grátis	Mercury 2 Mercury 2 medium Lançamento: 2026-02-24

Métrica	Gemma 4 31B Gemma 4 31B none Lançamento: 2026-04-02 Disponível grátis	Mercury 2 Mercury 2 medium Lançamento: 2026-02-24
Pontuação	6.7	6.5
Posição	#83	#92
Confiabilidade	10.0	10.0
Consistência	10.0	8.8
Testes corretos
Taxa de acerto por tentativa	50.0%	51.7%
Testes instáveis	0	3
Execuções totais	60	60
Custo por resultado	0.030	0.611
Custo total	$0.003	$0.055
Preço de entrada	$0.120 / 1M	$0.250 / 1M
Preço de saída	$0.370 / 1M	$0.750 / 1M
Tokens de saída	1,398	4,022
Tokens de raciocínio	0	58,405
Tempo de resposta (médio)	4.05s	2.27s
Tempo de resposta (máx.)	26.13s	14.63s
Tempo de resposta (total)	72.97s	43.20s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	6.5	10.0	50.0%	0		1.85s	45	0
Mercury 2	6.9	9.9	50.0%	0		1.12s	2,546	2,609

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	6.8	10.0	50.0%	0		14.84s	726	0
Mercury 2	7.2	6.5	66.7%	1		2.29s	270	8,514

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0
Mercury 2	10.0	10.0	100.0%	0		3.28s	268	4,887

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	10.0	10.0	100.0%	0		2.25s	285	0
Mercury 2	7.3	5.9	83.3%	1		1.11s	183	1,656

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	7.7	10.0	66.7%	0		3.22s	27	0
Mercury 2	2.9	7.2	11.1%	1		6.48s	41	30,754

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	10.0	10.0	100.0%	0		2.09s	117	0
Mercury 2	4.8	10.0	0.0%	0		821ms	137	542

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	6.5	10.0	50.0%	0		2.84s	78	0
Mercury 2	10.0	10.0	100.0%	0		1.07s	14	958

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	6.5	10.0	33.3%	0		4.23s	108	0
Mercury 2	5.4	10.0	33.3%	0		949ms	361	2,781

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0
Mercury 2	10.0	10.0	100.0%	0		1.89s	180	1,956

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	3.0	10.0	0.0%	0		1.25s	12	0
Mercury 2	3.0	10.0	0.0%	0		2.58s	22	3,748

Comparação rápida

Trocar par de comparação

Gemma 4 31BnoneDisponível grátisvsKimi K2.5medium Mercury 2mediumvsGPT-5.5none Gemini 3.1 Flash LitenonevsMercury 2medium Mercury 2mediumvsQwen3.5 Plus 2026-02-15none Gemma 4 31BnoneDisponível grátisvsQwen3.6 27Bmedium Gemini 2.5 FlashnonevsMercury 2medium Gemini 3.1 Flash LiteminimalvsMercury 2medium Mercury 2mediumvsGLM 5none Gemma 4 31BnoneDisponível grátisvsMiMo-V2-Omnimedium Gemma 4 31BnoneDisponível grátisvsGrok 4.20medium DeepSeek V4 ProhighvsGemma 4 31BnoneDisponível grátis DeepSeek V3.2nonevsMercury 2medium