AI BENCHY Compare

OpenAI: GPT-5.4 Mini vs Qwen: Qwen3.5-9B

Last updated at: 2026-03-17

Metric	GPT-5.4 Mini GPT-5.4 Mini none Release: 2026-03-17	Qwen3.5-9B Qwen3.5-9B none Release: 2026-03-02

Metric	GPT-5.4 Mini GPT-5.4 Mini none Release: 2026-03-17	Qwen3.5-9B Qwen3.5-9B none Release: 2026-03-02
Rank	#66	#67
Score	4.8	4.8
Consistency	8.6	10.0
Cost per result	0.737	0.111
Total Cost	$0.030	$0.005
Tests Correct
Attempt pass rate	31.4%	23.5%
Flaky tests	3	0
Total Runs	51	51
Output Tokens	2,085	2,945
Reasoning Tokens	0	0
Response Time (avg)	1.17s	1.22s
Response Time (max)	2.52s	5.91s
Response Time (total)	19.82s	20.74s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	3.1	8.1	8.3%	1		929ms	654	0
Qwen3.5-9B	3.1	9.9	0.0%	0		1.71s	582	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.52s	298	0
Qwen3.5-9B	3.0	10.0	0.0%	0		5.91s	1,255	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	10.0	10.0	100.0%	0		1.30s	222	0
Qwen3.5-9B	10.0	10.0	100.0%	0		847ms	249	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	3.5	4.4	33.3%	2		937ms	88	0
Qwen3.5-9B	3.0	10.0	0.0%	0		464ms	24	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	4.8	10.0	0.0%	0		1.82s	174	0
Qwen3.5-9B	4.4	9.9	0.0%	0		552ms	99	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	6.3	10.0	50.0%	0		728ms	101	0
Qwen3.5-9B	6.5	10.0	50.0%	0		514ms	75	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	5.4	10.0	33.3%	0		860ms	293	0
Qwen3.5-9B	3.2	9.9	0.0%	0		683ms	388	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.32s	255	0
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	273	0

Quick Compare

Switch Comparison Pair

GPT-5.4 MininonevsQwen3 Coder Nextmedium Qwen3.5-9BnonevsGLM 4.7 Flashmedium GPT-5.4 MininonevsGLM 4.7 Flashmedium GPT-5.4 MininonevsQwen3.5-9Bmedium Mistral Small 4mediumvsGPT-5.4 Mininone Mistral Small 4mediumvsQwen3.5-9Bnone MiniMax M2.5mediumFree AvailablevsGPT-5.4 Mininone MiniMax M2.5mediumFree AvailablevsQwen3.5-9Bnone gpt-oss-120bmediumFree AvailablevsQwen3.5-9Bnone GPT-5.4 MininonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-9BnonevsGrok 4.20 Multi-Agent Betamedium GPT-5 NanomediumvsQwen3.5-9Bnone