AI BENCHY Compare

OpenAI: GPT-5 Nano vs Qwen: Qwen3.5-9B

Last updated at: 2026-03-12

Metric	GPT-5 Nano GPT-5 Nano medium Release: 2025-08-07	Qwen3.5-9B Qwen3.5-9B none Release: 2026-03-02

Metric	GPT-5 Nano GPT-5 Nano medium Release: 2025-08-07	Qwen3.5-9B Qwen3.5-9B none Release: 2026-03-02
Rank	#38	#60
Avg Score	5.5	3.4
Consistency	7.0	10.0
Cost per result	0.856	0.111
Total Cost	$0.060	$0.005
Tests Correct
Attempt pass rate	60.4%	25.0%
Flaky tests	6	0
Total Runs	48	48
Output Tokens	4,386	2,939
Reasoning Tokens	142,080	0
Response Time (avg)	47.94s	1.06s
Response Time (max)	204.02s	5.91s
Response Time (total)	431.47s	16.95s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Total Output Tokens

Avg Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	7.0	10.0	66.7%	0		37.73s	1,107	19,968
Qwen3.5-9B	10.0	9.9	0.0%	0		1.02s	576	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	10.0	10.0	100.0%	0		65.96s	578	17,984
Qwen3.5-9B	10.0	10.0	0.0%	0		5.91s	1,255	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	10.0	1.7	50.0%	2		21.42s	453	10,560
Qwen3.5-9B	9.9	10.0	100.0%	0		847ms	249	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	4.0	4.4	55.6%	2		204.02s	237	64,448
Qwen3.5-9B	10.0	10.0	0.0%	0		464ms	24	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	3.0	10.0	0.0%	0		17.51s	202	4,608
Qwen3.5-9B	3.0	9.9	0.0%	0		552ms	99	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	9.0	6.8	83.3%	1		11.90s	382	4,096
Qwen3.5-9B	5.5	10.0	50.0%	0		514ms	75	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	4.0	7.2	44.4%	1		19.81s	869	13,440
Qwen3.5-9B	10.0	9.9	0.0%	0		683ms	388	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	10.0	10.0	100.0%	0		33.30s	558	6,976
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	273	0

Quick Compare

Switch Comparison Pair

DeepSeek V3.2nonevsGPT-5 Nanomedium Qwen3.5-9BnonevsGLM 4.7 Flashmedium GPT-5 NanomediumvsQwen3.5-Flashnone Gemini 2.5 FlashnonevsGPT-5 Nanomedium GPT-5 NanomediumvsGLM 5none GPT-5 NanomediumvsQwen3.5-122B-A10Bnone Seed-2.0-LitenonevsGPT-5 Nanomedium GPT-5 NanomediumvsQwen3.5-27Bnone GPT-5 NanomediumvsQwen3.5 Plus 2026-02-15none GPT-5 NanomediumvsQwen3.5-35B-A3Bnone GPT-5 NanomediumvsHunter Alphanone GPT-5 NanomediumvsGrok 4.20 Betanone