AI BENCHY Compare

Google: Gemma 4 31B vs OpenAI: GPT-5.3-Codex

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-05-10

Métrica	Gemma 4 31B Gemma 4 31B medium Lançamento: 2026-04-02 Disponível grátis	GPT-5.3-Codex GPT-5.3-Codex medium Lançamento: 2026-02-05

Métrica	Gemma 4 31B Gemma 4 31B medium Lançamento: 2026-04-02 Disponível grátis	GPT-5.3-Codex GPT-5.3-Codex medium Lançamento: 2026-02-05
Pontuação	8.2	8.2
Posição	#14	#13
Confiabilidade	6.7	10.0
Consistência	9.6	8.3
Testes corretos
Taxa de acerto por tentativa	77.2%	80.7%
Testes instáveis	1	4
Execuções totais	57	57
Custo por resultado	0.158	4.594
Custo total	$0.023	$0.598
Preço de entrada	$0.130 / 1M	$1.750 / 1M
Preço de saída	$0.380 / 1M	$14.000 / 1M
Tokens de saída	14,426	2,309
Tokens de raciocínio	37,964	36,880
Tempo de resposta (médio)	28.72s	15.33s
Tempo de resposta (máx.)	90.14s	100.93s
Tempo de resposta (total)	488.27s	291.34s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	10.0	10.0	100.0%	0		12.89s	962	2,046
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	240	1,722

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	4.7	1.6	66.7%	1		70.97s	3,166	5,449
GPT-5.3-Codex	10.0	10.0	100.0%	0		8.95s	491	1,530

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	364	2,731

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	10.0	10.0	100.0%	0		21.11s	1,822	2,951
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	234	728

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	7.7	10.0	66.7%	0		38.48s	4,349	8,985
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	64	25,308

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	10.0	10.0	100.0%	0		9.57s	105	888
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	187	331

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	10.0	10.0	100.0%	0		12.76s	533	2,035
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	93	693

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	9.9	10.0	100.0%	0		27.63s	1,797	5,596
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.12s	352	1,644

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	254	492

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemma 4 31B	3.0	10.0	0.0%	0		90.14s	1,692	10,014
GPT-5.3-Codex	2.8	1.6	33.3%	1		14.43s	30	1,701

Comparação rápida

Trocar par de comparação

Gemini 3 Flash PreviewnonevsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.3-Codexmedium Gemma 4 31BmediumDisponível grátisvsGPT-5.2 Chatnone Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium Gemma 4 31BmediumDisponível grátisvsGPT-5.5low Gemini 3.1 Flash LitelowvsGPT-5.3-Codexmedium Gemma 4 31BmediumDisponível grátisvsGPT-5.3 Chatnone DeepSeek V4 FlashhighvsGemma 4 31BmediumDisponível grátis DeepSeek V4 FlashhighvsGPT-5.3-Codexmedium Gemma 4 31BmediumDisponível grátisvsQwen3.6 Max Previewnone Gemma 4 31BmediumDisponível grátisvsRing 2.6 1tnoneDisponível grátis