OpenAI: GPT-5.5 vs Qwen: Qwen3.7 Plus

GPT-5.5 (low) leads on average score with 9.3 vs 7.9. Qwen3.7 Plus (medium) has the lower benchmark cost at $0.267 vs $1.253. GPT-5.5 (low) is faster at 10.13s vs 51.51s, with pass rates of 86.4% vs 75.8%.

Recommended modelGPT-5.5 (low)It has the best score here (9.3), while responding about 5.1x faster than Qwen3.7 Plus (medium).

Last updated at: 2026-07-18

Metric	GPT-5.5 GPT-5.5 low Release: 2026-04-24	Qwen3.7 Plus Qwen3.7 Plus medium Release: 2026-06-03

Metric	GPT-5.5 GPT-5.5 low Release: 2026-04-24	Qwen3.7 Plus Qwen3.7 Plus medium Release: 2026-06-03
Score	9.3	7.9
Rank	#6	#36
Reliability	10.0	10.0
Consistency	10.0	8.9
Tests Correct
Attempt pass rate	86.4%	75.8%
Flaky tests	0	3
Total Runs	66	66
Cost per result	6.594	2.072
Total Cost	$1.253	$0.267
Input Price	$5.000 / 1M	$0.320 / 1M
Output Price	$30.000 / 1M	$1.280 / 1M
Total Input Tokens	80,058	115,233
Output Tokens	5,378	6,162
Reasoning Tokens	23,040	173,267
Response Time (avg)	10.13s	51.51s
Response Time (max)	56.19s	315.30s
Response Time (total)	222.82s	1133.15s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#6 GPT-5.5

low

Cost: $0.068
Time: 37.0s
Tokens: 2,339 tok

#36 Qwen3.7 Plus

medium

Cost: $0.018
Time: 193.2s
Tokens: 10,821 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Category:

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020
Qwen3.7 Plus	10.0	10.0	100.0%	0		8.58s	672	195	5,065

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402
Qwen3.7 Plus	6.1	6.6	55.6%	1		108.60s	6,472	414	43,576

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		13.73s	56,868	3,635	1,297
Qwen3.7 Plus	8.2	6.9	66.7%	1		190.27s	89,228	4,403	57,645

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157
Qwen3.7 Plus	10.0	10.0	100.0%	0		21.75s	7,782	270	6,713

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609
Qwen3.7 Plus	3.6	7.2	22.2%	1		45.35s	771	57	27,073

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245
Qwen3.7 Plus	10.0	10.0	100.0%	0		25.48s	516	123	3,998

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.13s	699	102	5,013

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.38s	696	280	7,312

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101
Qwen3.7 Plus	10.0	10.0	100.0%	0		15.02s	8,193	292	1,831

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840
Qwen3.7 Plus	3.0	10.0	0.0%	0		91.07s	204	26	15,041

Quick Compare

Switch Comparison Pair

GPT-5.6 TerrahighvsQwen3.7 Plusmedium Kimi K3maxvsQwen3.7 Plusmedium Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Claude Opus 4.8lowvsQwen3.7 Plusmedium Qwen3.7 PlusmediumvsGLM 5.2high GPT-5.2 ChatnonevsQwen3.7 Plusmedium GPT-5.6 LunahighvsQwen3.7 Plusmedium Qwen3.7 PlusmediumvsInklinghigh GPT-5.5lowvsQwen3.7 Maxmedium DeepSeek V4 FlashhighvsQwen3.7 Plusmedium Gemini 3.5 FlashmediumvsGPT-5.5low Muse Spark 1.1highvsQwen3.7 Plusmedium