AI BENCHY Compare

OpenAI: GPT-5.5 vs Qwen: Qwen3.6 35B A3B

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-04-27

Métrica	GPT-5.5 GPT-5.5 low Lançamento: 2026-04-24	Qwen3.6 35B A3B Qwen3.6 35B A3B none Lançamento: 2026-04-20

Métrica	GPT-5.5 GPT-5.5 low Lançamento: 2026-04-24	Qwen3.6 35B A3B Qwen3.6 35B A3B none Lançamento: 2026-04-20
Pontuação	9.0	5.1
Posição	#5	#112
Confiabilidade	10.0	10.0
Consistência	9.6	7.4
Testes corretos
Taxa de acerto por tentativa	87.0%	39.6%
Testes instáveis	1	5
Execuções totais	54	54
Custo por resultado	4.534	0.471
Custo total	$0.681	$0.019
Preço de entrada	$5.000 / 1M	$0.162 / 1M
Preço de saída	$30.000 / 1M	$0.966 / 1M
Tokens de saída	1,959	17,503
Tokens de raciocínio	16,134	0
Tempo de resposta (médio)	8.39s	2.87s
Tempo de resposta (máx.)	56.19s	12.46s
Tempo de resposta (total)	151.01s	46.00s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	10.0	10.0	100.0%	0		4.15s	232	1,056
Qwen3.6 35B A3B	3.6	7.6	16.7%	1		2.10s	1,571	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	10.0	10.0	100.0%	0		7.79s	369	936
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		2.05s	921	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	10.0	10.0	100.0%	0		9.56s	303	717
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	10.0	10.0	100.0%	0		3.28s	228	157
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		1.46s	248	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	5.3	10.0	33.3%	0		27.57s	69	11,731
Qwen3.6 35B A3B	3.5	4.4	33.3%	2		7.45s	11,381	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	10.0	10.0	100.0%	0		3.45s	143	132
Qwen3.6 35B A3B	4.4	3.0	33.3%	1		3.51s	1,545	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	9.9	10.0	100.0%	0		2.98s	93	356
Qwen3.6 35B A3B	6.2	5.8	66.7%	1		1.86s	1,264	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	9.0	7.9	88.9%	1		4.48s	272	948
Qwen3.6 35B A3B	3.2	9.9	0.0%	0		1.00s	573	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.5	10.0	10.0	100.0%	0		4.96s	250	101
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Comparação rápida

Trocar par de comparação

Claude Opus 4.7nonevsGPT-5.5low Elephant AlphamediumvsQwen3.6 35B A3Bnone MiniMax M2.7mediumvsQwen3.6 35B A3Bnone Claude Opus 4.7mediumvsGPT-5.5low GPT-5.5lowvsQwen3.6 Max Previewmedium GPT-5.5lowvsQwen3.6 35B A3Bmedium Seed-2.0-LitemediumvsGPT-5.5low Qwen3.6 35B A3BnonevsGLM 4.7 Flashmedium GPT-5.5lowvsQwen3.5 Plus 2026-02-15medium Gemini 3.1 Pro PreviewmediumvsGPT-5.5low GPT-5.5lowvsHY3 PreviewhighDisponível grátis Mistral Small 4mediumvsQwen3.6 35B A3Bnone