AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs OpenAI: GPT-5.5

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-01

Métrica	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Lançamento: 2026-03-03	GPT-5.5 GPT-5.5 none Lançamento: 2026-04-24

Métrica	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Lançamento: 2026-03-03	GPT-5.5 GPT-5.5 none Lançamento: 2026-04-24
Pontuação	7.7	6.5
Posição	#38	#91
Confiabilidade	10.0	10.0
Consistência	10.0	8.7
Testes corretos
Taxa de acerto por tentativa	65.0%	56.7%
Testes instáveis	0	3
Execuções totais	60	60
Custo por resultado	0.481	2.167
Custo total	$0.063	$0.217
Preço de entrada	$0.250 / 1M	$5.000 / 1M
Preço de saída	$1.500 / 1M	$30.000 / 1M
Tokens de saída	2,204	1,956
Tokens de raciocínio	33,657	0
Tempo de resposta (médio)	3.94s	1.93s
Tempo de resposta (máx.)	14.93s	5.56s
Tempo de resposta (total)	78.74s	38.64s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	9.1	10.0	75.0%	0		2.33s	570	4,305
GPT-5.5	6.9	7.9	66.7%	1		1.31s	213	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	6.8	10.0	50.0%	0		3.98s	455	5,510
GPT-5.5	6.8	10.0	50.0%	0		1.52s	447	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		14.93s	327	7,347
GPT-5.5	3.0	10.0	0.0%	0		5.56s	300	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		2.29s	279	2,952
GPT-5.5	10.0	10.0	100.0%	0		1.18s	222	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	3.0	10.0	0.0%	0		4.21s	18	5,325
GPT-5.5	2.9	7.2	11.1%	1		1.31s	52	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		3.16s	96	1,488
GPT-5.5	10.0	10.0	100.0%	0		3.41s	124	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		1.91s	72	2,121
GPT-5.5	6.2	5.8	66.7%	1		1.15s	81	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	7.7	10.0	66.7%	0		5.30s	141	1,896
GPT-5.5	7.7	10.0	66.7%	0		1.29s	252	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		3.80s	234	912
GPT-5.5	10.0	10.0	100.0%	0		3.90s	247	0

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Gemini 3.1 Flash Lite Preview	3.0	10.0	0.0%	0		2.68s	12	1,801
GPT-5.5	3.0	10.0	0.0%	0		5.01s	18	0

Comparação rápida

Trocar par de comparação

GPT-5.5nonevsQwen3.6 27Bmedium Mercury 2mediumvsGPT-5.5none DeepSeek V4 FlashhighvsGemini 3.1 Flash Lite Previewmedium Kimi K2.5mediumvsGPT-5.5none Gemini 3.1 Flash LiteminimalvsGPT-5.5none Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.2 Chatnone Gemini 3.1 Flash Lite PreviewmediumvsQwen3.7 Maxnone DeepSeek V4 ProhighvsGPT-5.5none Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.3 Chatnone Gemini 3.1 Flash Lite PreviewmediumvsStep 3.7 Flashlow DeepSeek V3.2mediumvsGPT-5.5none GPT-5.5nonevsMimo V2 Omnimedium