AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.4 Mini

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-05-28

Métrica	Claude Opus 4.8 Claude Opus 4.8 none Lançamento: 2026-05-28	GPT-5.4 Mini GPT-5.4 Mini medium Lançamento: 2026-03-17

Métrica	Claude Opus 4.8 Claude Opus 4.8 none Lançamento: 2026-05-28	GPT-5.4 Mini GPT-5.4 Mini medium Lançamento: 2026-03-17
Pontuação	7.3	7.3
Posição	#63	#62
Confiabilidade	10.0	10.0
Consistência	9.2	7.9
Testes corretos
Taxa de acerto por tentativa	65.0%	71.7%
Testes instáveis	2	5
Execuções totais	60	60
Custo por resultado	4.324	4.417
Custo total	$0.519	$0.486
Preço de entrada	$5.000 / 1M	$0.750 / 1M
Preço de saída	$25.000 / 1M	$4.500 / 1M
Tokens de saída	8,098	2,160
Tokens de raciocínio	0	100,548
Tempo de resposta (médio)	3.51s	22.10s
Tempo de resposta (máx.)	17.73s	138.75s
Tempo de resposta (total)	70.19s	442.09s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	1,472	0
GPT-5.4 Mini	8.6	7.9	91.7%	1		4.05s	296	2,876

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	6.8	10.0	50.0%	0		3.59s	1,323	0
GPT-5.4 Mini	7.5	6.0	83.3%	1		73.25s	446	32,513

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	3,259	0
GPT-5.4 Mini	10.0	10.0	100.0%	0		17.81s	317	4,317

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	308	0
GPT-5.4 Mini	10.0	10.0	100.0%	0		2.43s	234	650

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	61	0
GPT-5.4 Mini	4.1	4.4	44.5%	2		65.31s	60	43,286

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	230	0
GPT-5.4 Mini	4.5	10.0	0.0%	0		3.72s	150	510

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	95	0
GPT-5.4 Mini	9.8	10.0	100.0%	0		2.13s	96	1,185

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	783	0
GPT-5.4 Mini	7.8	10.0	66.7%	0		4.37s	278	2,443

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	355	0
GPT-5.4 Mini	4.7	1.6	66.7%	1		9.62s	251	2,594

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	212	0
GPT-5.4 Mini	3.0	10.0	0.0%	0		30.10s	32	10,174

Comparação rápida

Trocar par de comparação

Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Claude Opus 4.8nonevsRing-2.6-1Tmedium Claude Opus 4.8nonevsGPT-5.2medium Ring-2.6-1TnonevsGPT-5.4 Minimedium Claude Opus 4.8nonevsGLM 5V Turbomedium Claude Opus 4.8nonevsGPT-5.4 Nanomedium Claude Opus 4.8nonevsStep 3.5 Flashmedium Gemini 3.1 Flash LitelowvsGPT-5.4 Minimedium Claude Opus 4.8nonevsGPT-5 Minimedium Claude Opus 4.8nonevsKimi K2.6mediumDisponível grátis Claude Opus 4.8nonevsMiMo-V2.5medium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.4 Minimedium