AI BENCHY Compare

OpenAI: GPT-5.3 Chat vs Z.ai: GLM 5 Turbo

Resumo

Comparação benchmark GPT-5.3 Chat vs GLM 5 Turbo: GLM 5 Turbo lidera na pontuação média com 8.4 vs 7.5. GLM 5 Turbo tem menor custo de benchmark com $0.323 vs $0.433. GPT-5.3 Chat é mais rápido com 6.34s vs 23.00s, com taxas de acerto de 66.7% vs 74.6%.

Modelo recomendado: GPT-5.3 Chat - Oferece o melhor compromisso geral: pontuação competitiva (7.5), resposta mais rápida que GLM 5 Turbo e custo equilibrado.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-12

Métrica	GPT-5.3 Chat GPT-5.3 Chat none Lançamento: 2026-03-03	GLM 5 Turbo GLM 5 Turbo medium Lançamento: 2026-03-15

Métrica	GPT-5.3 Chat GPT-5.3 Chat none Lançamento: 2026-03-03	GLM 5 Turbo GLM 5 Turbo medium Lançamento: 2026-03-15
Pontuação	7.5	8.4
Posição	#47	#24
Confiabilidade	10.0	10.0
Consistência	8.1	8.5
Testes corretos
Taxa de acerto por tentativa	66.7%	74.6%
Testes instáveis	5	4
Execuções totais	63	63
Custo por resultado	3.605	2.011
Custo total	$0.433	$0.323
Preço de entrada	$1.750 / 1M	$1.200 / 1M
Preço de saída	$14.000 / 1M	$4.000 / 1M
Total de tokens de entrada	34,209	35,593
Tokens de saída	26,617	12,245
Tokens de raciocínio	0	62,277
Tempo de resposta (médio)	6.34s	23.00s
Tempo de resposta (máx.)	18.33s	194.23s
Tempo de resposta (total)	133.13s	482.97s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#47 GPT-5.3 Chat

none

Cost: $0.008
Time: 8.1s
Tokens: 634 tok

#24 GLM 5 Turbo

medium

Cost: $0.074
Time: 206.0s
Tokens: 18,549 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	606	3,167	0
GLM 5 Turbo	10.0	10.0	100.0%	0		4.82s	555	362	3,137

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	5.6	4.7	55.6%	2		10.52s	7,302	6,632	0
GLM 5 Turbo	8.2	9.3	66.7%	0		45.90s	5,941	363	25,381

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	11,019	2,614	0
GLM 5 Turbo	10.0	10.0	100.0%	0		13.88s	12,714	390	2,037

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	7,140	942	0
GLM 5 Turbo	10.0	10.0	100.0%	0		6.19s	7,107	577	3,632

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	723	8,264	0
GLM 5 Turbo	2.9	4.4	22.2%	2		71.07s	489	9,665	19,279

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	477	319	0
GLM 5 Turbo	6.1	3.1	66.7%	1		10.05s	477	60	2,216

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	9.8	10.0	100.0%	0		3.51s	660	1,491	0
GLM 5 Turbo	10.0	10.0	100.0%	0		5.38s	636	255	2,183

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.99s	642	1,758	0
GLM 5 Turbo	8.7	7.9	77.8%	1		5.23s	609	312	2,647

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	5,445	861	0
GLM 5 Turbo	10.0	10.0	100.0%	0		9.84s	6,879	241	446

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
GPT-5.3 Chat	3.0	10.0	0.0%	0		4.38s	195	569	0
GLM 5 Turbo	3.0	10.0	0.0%	0		40.17s	186	20	1,319

Comparação rápida

Trocar par de comparação

Mercury 2mediumvsGPT-5.3 Chatnone Kimi K2.5mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.6 Flashmedium DeepSeek V3.2mediumvsGPT-5.3 Chatnone GPT-5.2 ChatnonevsGLM 5 Turbomedium GPT-5.3 ChatnonevsGrok Build 0.1medium Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2.5-Promedium MiniMax M3mediumvsGPT-5.3 Chatnone Gemini 3 Flash PreviewlowvsGPT-5.3 Chatnone DeepSeek V4 FlashhighvsGLM 5 Turbomedium GPT-5.3 ChatnonevsGrok 4.20medium