AI BENCHY Compare

Qwen: Qwen3.5-35B-A3B vs Z.ai: GLM 5.1

Last updated at: 2026-05-29

Metric	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Release: 2026-02-24	GLM 5.1 GLM 5.1 medium Release: 2026-04-07

Metric	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Release: 2026-02-24	GLM 5.1 GLM 5.1 medium Release: 2026-04-07
Score	7.3	7.4
Rank	#68	#56
Reliability	10.0	5.0
Consistency	7.5	8.3
Tests Correct
Attempt pass rate	73.3%	71.7%
Flaky tests	6	4
Total Runs	60	60
Cost per result	4.865	2.382
Total Cost	$0.536	$0.286
Input Price	$0.139 / 1M	$0.980 / 1M
Output Price	$1.000 / 1M	$3.080 / 1M
Output Tokens	31,242	11,511
Reasoning Tokens	330,546	71,979
Response Time (avg)	69.66s	33.45s
Response Time (max)	409.98s	172.60s
Response Time (total)	1393.17s	635.63s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		21.13s	798	42,652
GLM 5.1	10.0	10.0	100.0%	0		8.31s	401	5,122

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	6.5	10.0	50.0%	0		244.54s	14,456	88,431
GLM 5.1	4.7	1.6	66.7%	2		145.56s	4,727	34,384

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	4.7	1.6	66.7%	1		75.34s	775	12,485
GLM 5.1	9.5	10.0	100.0%	0		43.11s	327	4,206

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	7.3	5.9	83.3%	1		59.33s	235	19,493
GLM 5.1	10.0	10.0	100.0%	0		9.33s	991	4,552

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	4.1	4.4	44.5%	2		88.34s	41	46,368
GLM 5.1	5.3	10.0	33.3%	0		29.77s	969	11,314

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	2.8	1.6	33.3%	1		30.30s	20	3,753
GLM 5.1	10.0	10.0	100.0%	0		20.95s	2,875	2,875

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		24.45s	97	17,361
GLM 5.1	6.4	5.8	66.7%	1		7.47s	204	1,617

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	8.2	7.2	88.9%	1		33.13s	3,592	26,585
GLM 5.1	8.2	7.2	88.9%	1		31.64s	935	5,730

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		4.65s	309	1,365
GLM 5.1	3.0	10.0	0.0%	0		0ms	0	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-35B-A3B	3.0	10.0	0.0%	0		177.35s	10,919	72,053
GLM 5.1	3.0	10.0	0.0%	0		29.40s	82	2,179

Quick Compare

Switch Comparison Pair

Gemini 3.1 Flash LitelowvsGLM 5.1medium GPT-5.3 ChatnonevsGLM 5.1medium Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Ring-2.6-1TnonevsQwen3.5-35B-A3Bmedium Step 3.7 FlashlowvsGLM 5.1medium Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium Qwen3.5-35B-A3BmediumvsStep 3.7 Flashhigh Qwen3.5-35B-A3BmediumvsStep 3.7 Flashlow Claude Opus 4.8nonevsGLM 5.1medium GPT-5.3 ChatnonevsQwen3.5-35B-A3Bmedium Gemini 3.1 Flash LitelowvsQwen3.5-35B-A3Bmedium Ring-2.6-1TnonevsGLM 5.1medium