AI BENCHY Compare

OpenAI: GPT-5 Mini vs Qwen: Qwen3.6 Max Preview

Last updated at: 2026-04-27

Metric	GPT-5 Mini GPT-5 Mini medium Release: 2025-08-07	Qwen3.6 Max Preview Qwen3.6 Max Preview none Release: 2026-04-20

Metric	GPT-5 Mini GPT-5 Mini medium Release: 2025-08-07	Qwen3.6 Max Preview Qwen3.6 Max Preview none Release: 2026-04-20
Score	7.0	7.3
Rank	#58	#56
Reliability	N/A	10.0
Consistency	8.6	8.7
Tests Correct
Attempt pass rate	61.1%	66.7%
Flaky tests	3	3
Total Runs	54	54
Cost per result	1.415	0.827
Total Cost	$0.128	$0.083
Input Price	$0.250 / 1M	$1.300 / 1M
Output Price	$2.000 / 1M	$7.800 / 1M
Output Tokens	6,379	4,732
Reasoning Tokens	53,482	0
Response Time (avg)	23.98s	3.38s
Response Time (max)	88.15s	20.51s
Response Time (total)	431.56s	60.83s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	7.1	7.6	66.7%	1		13.86s	1,715	6,378
Qwen3.6 Max Preview	5.2	7.9	41.7%	1		2.63s	513	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	10.0	10.0	100.0%	0		23.18s	483	4,160
Qwen3.6 Max Preview	5.0	2.0	66.7%	1		3.45s	426	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	10.0	10.0	100.0%	0		88.15s	754	11,520
Qwen3.6 Max Preview	3.0	10.0	0.0%	0		20.51s	2,842	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	10.0	10.0	100.0%	0		12.58s	453	3,200
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		2.87s	243	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	3.6	7.2	22.2%	1		44.63s	293	14,016
Qwen3.6 Max Preview	7.7	10.0	66.7%	0		1.22s	18	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	4.5	10.0	0.0%	0		13.50s	349	1,856
Qwen3.6 Max Preview	4.3	10.0	0.0%	0		1.62s	76	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	8.0	6.6	83.3%	1		15.66s	318	4,992
Qwen3.6 Max Preview	8.4	6.9	83.3%	1		1.45s	69	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	5.6	9.8	33.3%	0		14.09s	1,527	5,760
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		2.38s	323	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Mini	10.0	10.0	100.0%	0		18.64s	487	1,600
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		5.27s	222	0

Quick Compare

Switch Comparison Pair

GPT-5.4 MinimediumvsQwen3.6 Max Previewnone Qwen3.6 Max PreviewnonevsMiMo-V2-Flashmedium GPT-5.2mediumvsQwen3.6 Max Previewnone Gemma 4 31BnoneFree AvailablevsGPT-5 Minimedium Seed-2.0-MinimediumvsQwen3.6 Max Previewnone GPT-5.4 NanomediumvsQwen3.6 Max Previewnone DeepSeek V4 ProhighvsGPT-5 Minimedium GPT-5 MinimediumvsQwen3.5 Plus 2026-02-15none Claude Opus 4.6mediumvsQwen3.6 Max Previewnone Kimi K2.5mediumvsQwen3.6 Max Previewnone DeepSeek V4 PrononevsGPT-5 Minimedium Qwen3.6 Max PreviewnonevsMiMo-V2-Omnimedium