AI BENCHY Compare

OpenAI: GPT-5.2 vs Qwen: Qwen3.7 Max

Last updated at: 2026-05-22

Metric	GPT-5.2 GPT-5.2 medium Release: 2025-12-11	Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22

Metric	GPT-5.2 GPT-5.2 medium Release: 2025-12-11	Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22
Score	7.4	7.9
Rank	#57	#26
Reliability	10.0	10.0
Consistency	8.3	10.0
Tests Correct
Attempt pass rate	70.0%	70.0%
Flaky tests	4	0
Total Runs	60	60
Cost per result	4.081	0.719
Total Cost	$0.490	$0.101
Input Price	$1.750 / 1M	$2.500 / 1M
Output Price	$14.000 / 1M	$7.500 / 1M
Output Tokens	2,754	1,988
Reasoning Tokens	28,303	0
Response Time (avg)	16.44s	1.30s
Response Time (max)	77.80s	3.92s
Response Time (total)	213.77s	25.95s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	6.5	8.0	58.3%	1		7.81s	567	2,002
Qwen3.7 Max	6.5	10.0	50.0%	0		1.08s	242	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	10.0	10.0	100.0%	0		23.15s	490	8,269
Qwen3.7 Max	6.8	10.0	50.0%	0		1.39s	576	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	10.0	10.0	100.0%	0		14.06s	291	1,757
Qwen3.7 Max	3.0	10.0	0.0%	0		2.17s	171	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	10.0	10.0	100.0%	0		3.15s	234	420
Qwen3.7 Max	10.0	10.0	100.0%	0		1.35s	243	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	5.9	7.2	55.6%	1		77.80s	42	10,342
Qwen3.7 Max	7.7	10.0	66.7%	0		975ms	15	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	3.7	9.7	0.0%	0		4.32s	162	269
Qwen3.7 Max	10.0	10.0	100.0%	0		1.04s	120	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	9.9	10.0	100.0%	0		3.12s	94	614
Qwen3.7 Max	10.0	10.0	100.0%	0		943ms	72	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	7.6	7.3	77.8%	1		5.47s	609	938
Qwen3.7 Max	10.0	10.0	100.0%	0		1.13s	314	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	4.7	1.6	66.7%	1		10.30s	239	469
Qwen3.7 Max	10.0	10.0	100.0%	0		3.92s	222	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	3.0	10.0	0.0%	0		28.18s	26	3,223
Qwen3.7 Max	3.0	10.0	0.0%	0		856ms	13	0

Quick Compare

Switch Comparison Pair

GPT-5.4mediumvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGLM 5 Turbomedium DeepSeek V4 FlashhighFree AvailablevsGPT-5.2medium Gemini 3.5 FlashminimalvsQwen3.7 Maxnone Gemini 3.1 Flash LitelowvsGPT-5.2medium Gemma 4 31BmediumFree AvailablevsQwen3.7 Maxnone Gemini 3.1 Flash Lite PreviewnonevsGPT-5.2medium Qwen3.7 MaxnonevsGrok 4.3medium Ring-2.6-1TnonevsGPT-5.2medium Seed-2.0-LitemediumvsQwen3.7 Maxnone Gemini 3.1 Flash Lite PreviewmediumvsQwen3.7 Maxnone Gemini 3.1 Flash LitemediumvsQwen3.7 Maxnone