AI BENCHY Compare

DeepSeek: DeepSeek V3.2 vs Z.ai: GLM 5

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-04-04

Métrica	DeepSeek V3.2 DeepSeek V3.2 none Lançamento: 2025-12-01	GLM 5 GLM 5 none Lançamento: 2026-02-12

Métrica	DeepSeek V3.2 DeepSeek V3.2 none Lançamento: 2025-12-01	GLM 5 GLM 5 none Lançamento: 2026-02-12
Pontuação	6.4	6.7
Posição	#51	#49
Consistência	8.5	10.0
Testes corretos
Taxa de acerto por tentativa	51.0%	52.9%
Testes instáveis	3	0
Execuções totais	51	51
Custo por resultado	0.220	0.201
Custo total	$0.016	$0.019
Preço de entrada	$0.260 / 1M	$0.720 / 1M
Preço de saída	$0.380 / 1M	$2.300 / 1M
Tokens de saída	7,831	1,551
Tokens de raciocínio	0	0
Tempo de resposta (médio)	12.35s	3.77s
Tempo de resposta (máx.)	115.89s	11.07s
Tempo de resposta (total)	209.94s	37.66s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	3.2	9.8	0.0%	0		7.63s	1,419	0
GLM 5	4.8	10.0	25.0%	0		2.37s	275	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	6.5	10.0	0.0%	0		115.89s	2,887	0
GLM 5	3.0	10.0	0.0%	0		4.98s	406	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	6.3	5.8	66.7%	1		9.42s	1,710	0
GLM 5	10.0	10.0	100.0%	0		5.78s	203	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	3.6	7.2	22.2%	1		1.61s	24	0
GLM 5	3.0	10.0	0.0%	0		2.24s	19	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	10.0	10.0	100.0%	0		2.86s	67	0
GLM 5	10.0	10.0	100.0%	0		3.27s	103	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	10.0	10.0	100.0%	0		1.52s	66	0
GLM 5	10.0	10.0	100.0%	0		1.48s	61	0

Puzzle Solving	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	8.5	7.5	88.9%	1		7.37s	1,136	0
GLM 5	7.7	10.0	66.7%	0		2.05s	264	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
DeepSeek V3.2	10.0	10.0	100.0%	0		11.85s	522	0
GLM 5	10.0	10.0	100.0%	0		11.07s	220	0

Comparação rápida

Trocar par de comparação

DeepSeek V3.2nonevsMercury 2medium DeepSeek V3.2nonevsGPT-5 Nanomedium GPT-5 MinimediumvsGLM 5none DeepSeek V3.2nonevsGrok 4.20 Multi Agent Betamedium Nemotron 3 SupermediumDisponível grátisvsGLM 5none Grok 4.1 FastmediumvsGLM 5none Hunter AlphamediumvsGLM 5none DeepSeek V3.2nonevsgpt-oss-120bmediumDisponível grátis GPT-5.4 MinimediumvsGLM 5none Grok 4.20mediumvsGLM 5none Mercury 2mediumvsGLM 5none GPT-5 NanomediumvsGLM 5none