AI BENCHY Compare

Qwen: Qwen3.5-122B-A10B vs Z.ai: GLM 5

Last updated at: 2026-04-14

Metric	Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium Release: 2026-02-24	GLM 5 GLM 5 medium Release: 2026-02-12

Metric	Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium Release: 2026-02-24	GLM 5 GLM 5 medium Release: 2026-02-12
Score	8.1	8.4
Rank	#17	#11
Consistency	8.6	8.2
Tests Correct
Attempt pass rate	79.6%	85.2%
Flaky tests	3	4
Total Runs	54	54
Cost per result	4.060	1.188
Total Cost	$0.528	$0.155
Input Price	$0.260 / 1M	$0.720 / 1M
Output Price	$2.080 / 1M	$2.300 / 1M
Output Tokens	17,635	20,163
Reasoning Tokens	162,668	58,337
Response Time (avg)	31.38s	23.34s
Response Time (max)	119.29s	79.09s
Response Time (total)	564.84s	233.40s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		9.75s	269	16,835
GLM 5	10.0	10.0	100.0%	0		23.66s	480	7,056

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	4.7	1.6	66.7%	1		70.98s	322	10,694
GLM 5	10.0	10.0	100.0%	0		79.09s	330	19,814

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		107.79s	483	11,337
GLM 5	10.0	10.0	100.0%	0		28.96s	662	3,242

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		23.41s	270	16,558
GLM 5	7.1	5.6	83.3%	1		8.90s	567	3,734

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	2.9	7.2	11.1%	1		63.40s	15,537	64,889
GLM 5	3.5	4.4	33.3%	2		0ms	13,176	14,137

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	3.4	2.2	33.3%	1		34.11s	66	7,592
GLM 5	6.1	3.1	66.7%	1		14.69s	2,020	2,248

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		9.88s	77	7,372
GLM 5	10.0	10.0	100.0%	0		7.25s	1,001	2,129

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		17.18s	289	26,165
GLM 5	10.0	10.0	100.0%	0		15.64s	1,694	4,983

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		4.60s	322	1,226
GLM 5	10.0	10.0	100.0%	0		15.93s	233	994

Quick Compare

Switch Comparison Pair

Gemini 3 Flash PreviewnonevsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewlowvsQwen3.5-122B-A10Bmedium GPT-5.2 ChatnonevsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-122B-A10Bmedium Gemini 3 Flash PreviewnonevsGLM 5medium Gemini 3.1 Flash Lite PreviewlowvsGLM 5medium Gemini 3 Flash PreviewlowvsGLM 5medium GPT-5.2 ChatnonevsGLM 5medium Gemini 3.1 Flash Lite PreviewnonevsGLM 5medium GPT-5.3 ChatnonevsQwen3.5-122B-A10Bmedium Gemini 3 Flash PreviewlowvsQwen3.5-122B-A10Bmedium GPT-5.3 ChatnonevsGLM 5medium