AI BENCHY Compare

DeepSeek: DeepSeek V3.2 vs Google: Gemini 2.5 Flash

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-04-16

Métrica	DeepSeek V3.2 DeepSeek V3.2 none Lançamento: 2025-12-01	Gemini 2.5 Flash Gemini 2.5 Flash none Lançamento: 2025-06-17

Métrica	DeepSeek V3.2 DeepSeek V3.2 none Lançamento: 2025-12-01	Gemini 2.5 Flash Gemini 2.5 Flash none Lançamento: 2025-06-17
Pontuação	6.1	6.2
Posição	#63	#61
Consistência	8.1	9.2
Testes corretos
Taxa de acerto por tentativa	50.0%	44.4%
Testes instáveis	4	2
Execuções totais	54	54
Custo por resultado	0.226	0.184
Custo total	$0.016	$0.013
Preço de entrada	$0.260 / 1M	$0.300 / 1M
Preço de saída	$0.380 / 1M	$2.500 / 1M
Tokens de saída	8,384	1,726
Tokens de raciocínio	0	0
Tempo de resposta (médio)	12.09s	903ms
Tempo de resposta (máx.)	115.89s	4.39s
Tempo de resposta (total)	217.56s	16.26s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	3.2	9.8	0.0%	0		7.63s	1,419	0
Gemini 2.5 Flash	3.0	10.0	0.0%	0		582ms	102	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	2.4	1.3	33.3%	1		7.63s	553	0
Gemini 2.5 Flash	10.0	10.0	100.0%	0		1.16s	453	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	6.5	10.0	0.0%	0		115.89s	2,887	0
Gemini 2.5 Flash	3.0	10.0	0.0%	0		4.39s	366	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	6.3	5.8	66.7%	1		9.42s	1,710	0
Gemini 2.5 Flash	10.0	10.0	100.0%	0		652ms	279	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	3.6	7.2	22.2%	1		1.61s	24	0
Gemini 2.5 Flash	5.9	7.2	55.6%	1		495ms	12	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	10.0	10.0	100.0%	0		2.86s	67	0
Gemini 2.5 Flash	5.0	10.0	0.0%	0		615ms	78	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	10.0	10.0	100.0%	0		1.52s	66	0
Gemini 2.5 Flash	8.0	6.8	66.7%	1		672ms	70	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	8.5	7.5	88.9%	1		7.37s	1,136	0
Gemini 2.5 Flash	5.7	10.0	33.3%	0		576ms	132	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	10.0	10.0	100.0%	0		11.85s	522	0
Gemini 2.5 Flash	10.0	10.0	100.0%	0		1.91s	234	0

Comparação rápida

Trocar par de comparação

Gemini 2.5 FlashnonevsGPT-5 Nanomedium DeepSeek V3.2nonevsGPT-5 Nanomedium DeepSeek V3.2nonevsgpt-oss-120bmediumDisponível grátis Gemini 2.5 Flashnonevsgpt-oss-120bmediumDisponível grátis Gemini 2.5 FlashnonevsMercury 2medium DeepSeek V3.2nonevsMercury 2medium DeepSeek V3.2nonevsMiniMax M2.5mediumDisponível grátis DeepSeek V3.2nonevsMistral Small 4medium Gemini 2.5 FlashnonevsMiniMax M2.5mediumDisponível grátis Gemini 2.5 FlashnonevsGrok 4.1 Fastmedium Gemini 2.5 FlashnonevsMistral Small 4medium DeepSeek V3.2nonevsGrok 4.1 Fastmedium