AI BENCHY Compare

Anthropic: Claude Sonnet 5 vs OpenAI: GPT-5.2 Chat

Resumo

Comparação benchmark Claude Sonnet 5 vs GPT-5.2 Chat: GPT-5.2 Chat lidera na pontuação média com 8.5 vs 7.9. GPT-5.2 Chat tem menor custo de benchmark com $0.393 vs $0.550. GPT-5.2 Chat é mais rápido com 7.13s vs 9.94s, com taxas de acerto de 79.4% vs 74.6%.

Modelo recomendado: GPT-5.2 Chat - Tem a pontuação mais forte nesta comparação (8.5) e o melhor equilíbrio geral entre custo e tempo de resposta entre os 2 modelos.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-30

Métrica	Claude Sonnet 5 Claude Sonnet 5 medium Lançamento: 2026-06-30	GPT-5.2 Chat GPT-5.2 Chat none Lançamento: 2025-12-11

Métrica	Claude Sonnet 5 Claude Sonnet 5 medium Lançamento: 2026-06-30	GPT-5.2 Chat GPT-5.2 Chat none Lançamento: 2025-12-11
Pontuação	7.9	8.5
Posição	#30	#19
Confiabilidade	10.0	10.0
Consistência	9.0	8.9
Testes corretos
Taxa de acerto por tentativa	79.4%	74.6%
Testes instáveis	3	3
Execuções totais	63	63
Custo por resultado	3.662	2.803
Custo total	$0.550	$0.393
Preço de entrada	$2.000 / 1M	$1.750 / 1M
Preço de saída	$10.000 / 1M	$14.000 / 1M
Total de tokens de entrada	67,416	34,212
Tokens de saída	34,012	23,744
Tokens de raciocínio	7,673	0
Tempo de resposta (médio)	9.94s	7.13s
Tempo de resposta (máx.)	56.94s	38.52s
Tempo de resposta (total)	208.71s	149.69s

Geração showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#30 Claude Sonnet 5

medium

Custo: $0.007
Tempo: 6.4s
Tokens: 832 tok

#19 GPT-5.2 Chat

none

Custo: $0.010
Tempo: 15.3s
Tokens: 797 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	10.0	10.0	100.0%	0		3.80s	834	1,220	446
GPT-5.2 Chat	8.7	7.9	91.7%	1		3.40s	606	1,807	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	9.0	7.9	88.9%	1		17.28s	10,590	13,153	2,379
GPT-5.2 Chat	8.8	7.8	88.9%	1		9.82s	7,305	6,731	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	4.5	2.1	66.7%	1		37.01s	29,394	4,848	2,170
GPT-5.2 Chat	10.0	10.0	100.0%	0		9.12s	11,019	1,243	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	10.0	10.0	100.0%	0		3.16s	10,503	312	0
GPT-5.2 Chat	10.0	10.0	100.0%	0		3.05s	7,140	980	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	7.7	10.0	66.7%	0		20.38s	975	12,140	1,994
GPT-5.2 Chat	5.3	10.0	33.3%	0		17.78s	723	7,810	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	4.8	3.2	33.3%	1		4.32s	708	264	0
GPT-5.2 Chat	4.4	3.0	33.3%	1		3.20s	477	335	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	9.9	10.0	100.0%	0		3.10s	909	318	269
GPT-5.2 Chat	9.8	10.0	100.0%	0		5.51s	660	1,441	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	7.7	10.0	66.7%	0		2.98s	894	407	121
GPT-5.2 Chat	7.7	10.0	66.7%	0		4.10s	642	1,603	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	10.0	10.0	100.0%	0		10.70s	12,351	433	90
GPT-5.2 Chat	10.0	10.0	100.0%	0		4.68s	5,445	555	0

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	3.0	10.0	0.0%	0		7.06s	258	917	204
GPT-5.2 Chat	3.0	10.0	0.0%	0		6.89s	195	1,239	0

Comparação rápida

Trocar par de comparação

Seed-2.0-LitemediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsStep 3.7 Flashmedium GPT-5.2 ChatnonevsGLM 5medium Claude Sonnet 5mediumvsStep 3.7 Flashlow GPT-5.2 ChatnonevsGLM 5.2medium DeepSeek V4 FlashhighvsGPT-5.2 Chatnone Claude Opus 4.7mediumvsGPT-5.2 Chatnone Claude Sonnet 5mediumvsDeepSeek V4 Prohigh Gemini 2.5 FlashmediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.7 Plusmedium Claude Opus 4.8mediumvsGPT-5.2 Chatnone Claude Sonnet 5mediumvsGPT-5.3 Chatnone