Inception: Mercury 2 vs OpenAI: GPT-5.5

Mercury 2 (medium) lidera na pontuação média com 7.0 vs 6.9. Mercury 2 (medium) tem menor custo de benchmark com $0.093 vs $0.544. GPT-5.5 é mais rápido com 2.36s vs 2.72s, com taxas de acerto de 51.5% vs 56.1%.

Modelo recomendadoMercury 2 (medium)Tem a melhor pontuação aqui (7.0) e custa cerca de 5.9x menos que GPT-5.5.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-07-24

Métrica	Mercury 2 Mercury 2 medium Lançamento: 2026-02-24	GPT-5.5 GPT-5.5 none Lançamento: 2026-04-24

Métrica	Mercury 2 Mercury 2 medium Lançamento: 2026-02-24	GPT-5.5 GPT-5.5 none Lançamento: 2026-04-24
Pontuação	7.0	6.9
Posição	#82	#91
Confiabilidade	10.0	10.0
Consistência	8.8	8.9
Testes corretos
Taxa de acerto por tentativa	51.5%	56.1%
Testes instáveis	3	3
Execuções totais	66	66
Custo por resultado	0.928	4.945
Custo total	$0.093	$0.544
Preço de entrada	$0.250 / 1M	$5.000 / 1M
Preço de saída	$0.750 / 1M	$30.000 / 1M
Total de tokens de entrada	109,572	79,285
Tokens de saída	10,313	4,915
Tokens de raciocínio	76,806	0
Tempo de resposta (médio)	2.72s	2.36s
Tempo de resposta (máx.)	14.63s	12.24s
Tempo de resposta (total)	57.12s	51.88s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#82 Mercury 2

medium

Custo: $0.002
Tempo: 2.1s
Tokens: 1,702 tok

#91 GPT-5.5

none

Custo: $0.090
Tempo: 54.3s
Tokens: 3,063 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Categoria:

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	6.9	9.9	50.0%	0		1.12s	554	2,546	2,609
GPT-5.5	6.9	7.9	66.7%	1		1.31s	606	213	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	8.2	7.7	77.8%	1		2.04s	7,065	296	11,328
GPT-5.5	5.5	10.0	33.3%	0		1.35s	7,305	462	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	6.7	9.1	50.0%	0		7.84s	87,365	6,533	20,474
GPT-5.5	6.5	10.0	50.0%	0		8.90s	56,092	3,244	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	7.3	5.9	83.3%	1		1.11s	6,234	183	1,656
GPT-5.5	10.0	10.0	100.0%	0		1.18s	7,140	222	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	2.9	7.2	11.1%	1		6.48s	695	41	30,754
GPT-5.5	2.9	7.2	11.1%	1		1.31s	723	52	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	4.8	10.0	0.0%	0		821ms	456	137	542
GPT-5.5	10.0	10.0	100.0%	0		3.41s	477	124	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	10.0	10.0	100.0%	0		1.07s	340	14	958
GPT-5.5	6.2	5.8	66.7%	1		1.15s	660	81	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	5.4	10.0	33.3%	0		949ms	601	361	2,781
GPT-5.5	7.7	10.0	66.7%	0		1.29s	642	252	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	10.0	10.0	100.0%	0		1.89s	6,080	180	1,956
GPT-5.5	10.0	10.0	100.0%	0		3.90s	5,445	247	0

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	3.0	10.0	0.0%	0		2.58s	182	22	3,748
GPT-5.5	3.0	10.0	0.0%	0		5.01s	195	18	0

Comparação rápida

Trocar par de comparação

GPT-5.5nonevsStep 3.7 Flashhigh Gemini 3.5 FlashnonevsMercury 2medium GPT-5.5nonevsQwen3.6 Flashmedium GPT-5.5nonevsMiMo-V2.5-Promedium Gemini 3.5 FlashminimalvsGPT-5.5none KAT-Coder-Pro V2.5mediumvsGPT-5.5none DeepSeek V4 PrononevsMercury 2medium Mercury 2mediumvsGPT-5.6 Solnone Seed-2.0-MinimediumvsGPT-5.5none GPT-5.5nonevsQwen3.6 35B A3Bmedium Mercury 2mediumvsStep 3.7 Flashhigh Kimi K2.5mediumvsGPT-5.5none