AI BENCHY Compare

OpenAI: GPT-5.4 Mini vs Qwen: Qwen3.5-35B-A3B

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-17

Métrica	GPT-5.4 Mini GPT-5.4 Mini medium Lançamento: 2026-03-17	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Lançamento: 2026-02-24

Métrica	GPT-5.4 Mini GPT-5.4 Mini medium Lançamento: 2026-03-17	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Lançamento: 2026-02-24
Posição	#34	#31
Pontuação	7.1	7.3
Consistência	7.2	6.6
Custo por resultado	3.610	3.877
Custo total	$0.289	$0.349
Testes corretos
Taxa de acerto por tentativa	68.6%	78.4%
Testes instáveis	6	7
Execuções totais	51	51
Tokens de saída	1,708	5,864
Tokens de raciocínio	58,019	175,683
Tempo de resposta (médio)	15.66s	42.48s
Tempo de resposta (máx.)	102.91s	106.00s
Tempo de resposta (total)	266.14s	722.12s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.4 Mini	8.6	7.9	91.7%	1		4.05s	296	2,876
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		21.13s	798	42,652

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.4 Mini	10.0	10.0	100.0%	0		17.81s	317	4,317
Qwen3.5-35B-A3B	4.7	1.6	66.7%	1		75.34s	775	12,485

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.4 Mini	10.0	10.0	100.0%	0		2.43s	234	650
Qwen3.5-35B-A3B	7.3	5.9	83.3%	1		59.33s	235	19,493

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.4 Mini	4.1	4.4	44.5%	2		65.31s	60	43,286
Qwen3.5-35B-A3B	4.1	4.4	44.5%	2		88.34s	41	46,368

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.4 Mini	4.5	10.0	0.0%	0		3.72s	150	510
Qwen3.5-35B-A3B	2.8	1.6	33.3%	1		30.30s	20	3,753

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.4 Mini	7.4	6.5	66.7%	1		2.50s	129	1,337
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		24.45s	97	17,361

Puzzle Solving	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.4 Mini	6.8	7.9	55.6%	1		4.33s	271	2,449
Qwen3.5-35B-A3B	6.4	4.4	77.8%	2		31.58s	3,589	32,206

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
GPT-5.4 Mini	4.7	1.6	66.7%	1		9.62s	251	2,594
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		4.65s	309	1,365

Comparação rápida

Trocar par de comparação

Claude Sonnet 4.6nonevsQwen3.5-35B-A3Bmedium Claude Sonnet 4.6nonevsGPT-5.4 Minimedium GPT-5.3 ChatnonevsQwen3.5-35B-A3Bmedium GPT-5.4 MinimediumvsQwen3.5 Plus 2026-02-15none GPT-5.4 MinimediumvsGLM 5none GPT-5.2 ChatnonevsQwen3.5-35B-A3Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-35B-A3Bmedium Qwen3.5-35B-A3BmediumvsGLM 5none Gemini 3.1 Flash Lite PreviewnonevsGPT-5.4 Minimedium Gemini 3 Flash PreviewnonevsQwen3.5-35B-A3Bmedium Gemini 3.1 Flash Lite PreviewlowvsQwen3.5-35B-A3Bmedium DeepSeek V3.2nonevsGPT-5.4 Minimedium