AI BENCHY Compare

Qwen: Qwen3.5-27B vs Z.ai: GLM 5

Last updated at: 2026-04-14

Metric	Qwen3.5-27B Qwen3.5-27B medium Release: 2026-02-24	GLM 5 GLM 5 none Release: 2026-02-12

Metric	Qwen3.5-27B Qwen3.5-27B medium Release: 2026-02-24	GLM 5 GLM 5 none Release: 2026-02-12
Score	8.4	6.6
Rank	#8	#50
Consistency	8.8	9.6
Tests Correct
Attempt pass rate	81.5%	51.9%
Flaky tests	3	1
Total Runs	54	54
Cost per result	3.822	0.217
Total Cost	$0.497	$0.020
Input Price	$0.195 / 1M	$0.720 / 1M
Output Price	$1.560 / 1M	$2.300 / 1M
Output Tokens	2,500	1,959
Reasoning Tokens	242,500	0
Response Time (avg)	53.03s	4.23s
Response Time (max)	163.96s	11.07s
Response Time (total)	954.46s	46.51s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	8.7	7.9	91.7%	1		19.75s	569	31,505
GLM 5	4.8	10.0	25.0%	0		2.37s	275	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	10.0	10.0	100.0%	0		70.35s	375	19,165
GLM 5	5.6	3.5	33.3%	1		8.84s	408	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	10.0	10.0	100.0%	0		163.96s	483	9,991
GLM 5	3.0	10.0	0.0%	0		4.98s	406	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	10.0	10.0	100.0%	0		30.26s	270	16,150
GLM 5	10.0	10.0	100.0%	0		5.78s	203	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	5.3	10.0	33.3%	0		79.53s	43	52,368
GLM 5	3.0	10.0	0.0%	0		2.24s	19	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	6.1	3.1	66.7%	1		101.41s	70	23,147
GLM 5	10.0	10.0	100.0%	0		3.27s	103	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	10.0	10.0	100.0%	0		19.66s	97	11,638
GLM 5	10.0	10.0	100.0%	0		1.48s	61	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	8.2	7.7	77.8%	1		64.61s	245	77,213
GLM 5	7.7	10.0	66.7%	0		2.05s	264	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-27B	10.0	10.0	100.0%	0		7.45s	348	1,323
GLM 5	10.0	10.0	100.0%	0		11.07s	220	0

Quick Compare

Switch Comparison Pair

Grok 4.1 FastmediumvsGLM 5none Nemotron 3 SupermediumFree AvailablevsGLM 5none Mercury 2mediumvsGLM 5none Gemini 3 Flash PreviewnonevsQwen3.5-27Bmedium Grok 4.20mediumvsGLM 5none Gemini 3.1 Flash Lite PreviewlowvsQwen3.5-27Bmedium Kimi K2.5mediumvsGLM 5none Gemini 3 Flash PreviewlowvsQwen3.5-27Bmedium GPT-5 MinimediumvsGLM 5none GPT-5 NanomediumvsGLM 5none GPT-5.2 ChatnonevsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-27Bmedium