AI BENCHY Compare

OpenAI: GPT-5.5 vs Qwen: Qwen3.7 Max

Last updated at: 2026-05-22

Metric	GPT-5.5 GPT-5.5 medium Release: 2026-04-24	Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22

Metric	GPT-5.5 GPT-5.5 medium Release: 2026-04-24	Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22
Score	8.7	7.9
Rank	#11	#26
Reliability	10.0	10.0
Consistency	8.8	10.0
Tests Correct
Attempt pass rate	86.7%	70.0%
Flaky tests	3	0
Total Runs	60	60
Cost per result	21.891	0.719
Total Cost	$3.503	$0.101
Input Price	$5.000 / 1M	$2.500 / 1M
Output Price	$30.000 / 1M	$7.500 / 1M
Output Tokens	1,973	1,988
Reasoning Tokens	109,510	0
Response Time (avg)	37.89s	1.30s
Response Time (max)	332.10s	3.92s
Response Time (total)	757.71s	25.95s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.66s	250	1,335
Qwen3.7 Max	6.5	10.0	50.0%	0		1.08s	242	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	8.2	6.7	83.3%	1		69.68s	341	19,515
Qwen3.7 Max	6.8	10.0	50.0%	0		1.39s	576	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		19.29s	312	2,841
Qwen3.7 Max	3.0	10.0	0.0%	0		2.17s	171	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.18s	234	593
Qwen3.7 Max	10.0	10.0	100.0%	0		1.35s	243	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	5.3	7.2	44.4%	1		164.14s	67	79,625
Qwen3.7 Max	7.7	10.0	66.7%	0		975ms	15	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.16s	138	223
Qwen3.7 Max	10.0	10.0	100.0%	0		1.04s	120	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		3.36s	93	538
Qwen3.7 Max	10.0	10.0	100.0%	0		943ms	72	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		6.78s	250	2,254
Qwen3.7 Max	10.0	10.0	100.0%	0		1.13s	314	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		10.57s	258	832
Qwen3.7 Max	10.0	10.0	100.0%	0		3.92s	222	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	2.8	1.6	33.3%	1		37.86s	30	1,754
Qwen3.7 Max	3.0	10.0	0.0%	0		856ms	13	0

Quick Compare

Switch Comparison Pair

GPT-5.4mediumvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGLM 5 Turbomedium Gemini 3.5 FlashminimalvsQwen3.7 Maxnone Gemma 4 31BmediumFree AvailablevsQwen3.7 Maxnone Gemini 3 Flash PreviewlowvsGPT-5.5medium Qwen3.7 MaxnonevsGrok 4.3medium Seed-2.0-LitemediumvsQwen3.7 Maxnone Gemini 3.1 Flash Lite PreviewmediumvsQwen3.7 Maxnone Gemini 3.5 FlashnonevsGPT-5.5medium Gemini 3.1 Flash LitemediumvsQwen3.7 Maxnone Gemini 2.5 FlashmediumvsQwen3.7 Maxnone Gemini 3 PRO PreviewmediumvsQwen3.7 Maxnone