Compared models

Recommended model GLM 5 (medium)

It has the strongest score in this comparison (7.7) and the best overall balance of cost and response time across all 4 models.

Detailed comparison

Metric	GLM 5 GLM 5 medium Release: 2026-02-12	GLM 5.1 GLM 5.1 medium Release: 2026-04-07	GLM 5 GLM 5 none Release: 2026-02-12	GLM 5.1 GLM 5.1 none Release: 2026-04-07

Metric	GLM 5 GLM 5 medium Release: 2026-02-12	GLM 5.1 GLM 5.1 medium Release: 2026-04-07	GLM 5 GLM 5 none Release: 2026-02-12	GLM 5.1 GLM 5.1 none Release: 2026-04-07
Score	7.7	7.1	5.7	5.5
Rank	#49	#82	#152	#163
Reliability	10.0	8.3	10.0	10.0
Consistency	8.1	8.4	9.3	8.2
Tests Correct
Attempt pass rate	78.8%	69.7%	42.4%	40.9%
Flaky tests	4	4	1	5
Total Runs	63	66	63	66
Cost per result	1.668	4.202	0.263	2.368
Total Cost	$0.307	$0.535	$0.041	$0.164
Input Price	$0.950 / 1M	$0.966 / 1M	$0.950 / 1M	$0.966 / 1M
Output Price	$2.551 / 1M	$3.036 / 1M	$2.551 / 1M	$3.036 / 1M
Total Input Tokens	35,224	82,623	37,135	124,209
Output Tokens	21,570	16,089	1,989	14,393
Reasoning Tokens	102,996	136,463	0	0
Response Time (avg)	33.54s	46.77s	4.03s	6.70s
Response Time (max)	99.85s	308.75s	11.07s	61.20s
Response Time (total)	435.99s	982.16s	56.37s	147.38s

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

medium

medium

Invalid SVG

none

none

Invalid SVG

Category:

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	10.0	10.0	100.0%	0	23.66s	555	480	7,056
GLM 5.1	10.0	10.0	100.0%	0	8.31s	555	401	5,122
GLM 5	4.8	10.0	25.0%	0	2.37s	510	275	0
GLM 5.1	4.0	6.3	25.0%	2	2.11s	555	305	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	10.0	10.0	100.0%	0	74.30s	7,254	2,997	52,930
GLM 5.1	4.6	3.7	44.5%	2	109.63s	5,702	4,871	37,826
GLM 5	4.0	7.8	11.1%	1	5.12s	7,256	428	0
GLM 5.1	3.9	9.7	0.0%	0	4.96s	7,256	525	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	5.0	5.0	50.0%	0	28.96s	12,804	662	3,242
GLM 5.1	9.8	10.0	100.0%	0	175.93s	66,926	4,761	65,248
GLM 5	1.5	5.0	0.0%	0	4.98s	12,812	406	0
GLM 5.1	2.8	1.8	33.3%	2	46.88s	99,907	12,768	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	7.1	5.6	83.3%	1	8.90s	5,508	567	3,734
GLM 5.1	10.0	10.0	100.0%	0	9.33s	7,107	991	4,552
GLM 5	10.0	10.0	100.0%	0	5.78s	7,107	203	0
GLM 5.1	10.0	10.0	100.0%	0	1.08s	7,107	204	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	3.5	4.4	33.3%	2	0ms	260	13,176	14,137
GLM 5.1	5.3	10.0	33.3%	0	29.77s	489	969	11,314
GLM 5	3.0	10.0	0.0%	0	2.24s	643	19	0
GLM 5.1	2.9	7.2	11.1%	1	1.99s	687	24	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	6.1	3.1	66.7%	1	14.69s	477	2,020	2,248
GLM 5.1	10.0	10.0	100.0%	0	20.95s	477	2,875	2,875
GLM 5	10.0	10.0	100.0%	0	3.27s	477	103	0
GLM 5.1	5.0	10.0	0.0%	0	790ms	477	39	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	10.0	10.0	100.0%	0	7.25s	636	1,001	2,129
GLM 5.1	6.4	5.8	66.7%	1	7.47s	634	204	1,617
GLM 5	10.0	10.0	100.0%	0	1.48s	636	61	0
GLM 5.1	9.8	10.0	100.0%	0	1.98s	636	66	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	10.0	10.0	100.0%	0	11.33s	609	33	4,076
GLM 5.1	8.2	7.2	88.9%	1	31.64s	609	935	5,730
GLM 5	7.7	10.0	66.7%	0	1.91s	609	261	0
GLM 5.1	7.7	10.0	66.7%	0	1.45s	609	151	0

Tool Calling	Score	Consistency	Attempt pass rate	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	10.0	10.0	100.0%	15.93s	6,935	233	994
GLM 5.1	3.0	10.0	0.0%	0ms	0	0	0
GLM 5	10.0	10.0	100.0%	11.07s	6,899	220	0
GLM 5.1	10.0	10.0	100.0%	10.68s	6,789	300	0

Trivia	Score	Consistency	Attempt pass rate	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GLM 5	3.0	10.0	0.0%	67.37s	186	401	12,450
GLM 5.1	3.0	10.0	0.0%	29.40s	124	82	2,179
GLM 5	3.0	10.0	0.0%	3.62s	186	13	0
GLM 5.1	3.0	10.0	0.0%	2.34s	186	11	0

Switch Comparison Pair