AI BENCHY 对比

Qwen: Qwen3.6 35B A3B vs Z.ai: GLM 5

摘要

Qwen3.6 35B A3B vs GLM 5 benchmark 对比：Qwen3.6 35B A3B 平均分领先，为 6.7 vs 6.0。 GLM 5 benchmark 成本更低，为 $0.027 vs $0.146。 GLM 5 更快，为 4.03s vs 18.08s，通过率为 63.5% vs 44.4%。

推荐模型: GLM 5 - 它的得分接近这里的最高分（6.0 vs 6.7），同时成本比Qwen3.6 35B A3B低约 5.6 倍。

基准结果生成自 AI BENCHY 测试套件，时间：: 2026-06-18

指标	Qwen3.6 35B A3B Qwen3.6 35B A3B medium 发布日期: 2026-04-20	GLM 5 GLM 5 none 发布日期: 2026-02-12

指标	Qwen3.6 35B A3B Qwen3.6 35B A3B medium 发布日期: 2026-04-20	GLM 5 GLM 5 none 发布日期: 2026-02-12
分数	6.7	6.0
排名	#75	#101
可靠性	10.0	10.0
一致性	9.6	9.7
测试正确
尝试通过率	63.5%	44.4%
不稳定测试	1	1
总运行次数	63	63
每个结果成本	1.094	0.263
总成本	$0.146	$0.027
输入价格	$0.140 / 1M	$0.600 / 1M
输出价格	$1.000 / 1M	$1.920 / 1M
总输入令牌	16,385	37,135
输出令牌	19,632	1,989
推理令牌	130,219	0
响应时间（平均）	18.08s	4.03s
响应时间（最大）	86.11s	11.07s
响应时间（总计）	343.61s	56.37s

生成展示

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#75 Qwen3.6 35B A3B

medium

无效SVG

成本: $0.000
时间: 300.0s
令牌: 0 tok

#101 GLM 5

none

成本: $0.007
时间: 32.1s
令牌: 2,023 tok

按分数排名的模型

分数 vs 总成本

响应时间（平均）

分数 vs 响应时间（平均）

总输出令牌

分数 vs 总输出令牌

类别细分

反AI技巧	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		6.02s	672	1,154	12,385
GLM 5	4.8	10.0	25.0%	0		2.37s	510	275	0

编程	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	7.7	10.0	66.7%	0		50.55s	5,051	7,929	37,223
GLM 5	4.0	7.8	11.1%	1		5.12s	7,256	428	0

综合	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	3.0	10.0	0.0%	0		0ms	0	0	0
GLM 5	3.0	10.0	0.0%	0		4.98s	12,812	406	0

数据解析与提取	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		12.99s	7,776	2,591	9,968
GLM 5	10.0	10.0	100.0%	0		5.78s	7,107	203	0

领域专项	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	5.3	7.2	44.4%	1		22.50s	771	6,193	39,116
GLM 5	3.0	10.0	0.0%	0		2.24s	643	19	0

通用智能	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	4.4	9.9	0.0%	0		8.66s	516	129	4,569
GLM 5	10.0	10.0	100.0%	0		3.27s	477	103	0

指令遵循	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		7.50s	699	219	7,404
GLM 5	10.0	10.0	100.0%	0		1.48s	636	61	0

谜题求解	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	8.0	10.0	66.7%	0		5.95s	696	655	9,228
GLM 5	7.7	10.0	66.7%	0		1.91s	609	261	0

工具调用	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	3.0	10.0	0.0%	0		0ms	0	0	0
GLM 5	10.0	10.0	100.0%	0		11.07s	6,899	220	0

常识问答	分数	一致性	尝试通过率	不稳定测试	测试正确	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.6 35B A3B	3.0	10.0	0.0%	0		32.90s	204	762	10,326
GLM 5	3.0	10.0	0.0%	0		3.62s	186	13	0

快速对比

切换对比组合

Gemini 3.5 FlashminimalvsQwen3.6 35B A3Bmedium North Mini Codemedium免费可用vsGLM 5none Gemini 3.1 Flash LiteminimalvsGLM 5none Gemini 3 Flash PreviewnonevsQwen3.6 35B A3Bmedium Gemini 3.1 Flash Lite PreviewlowvsQwen3.6 35B A3Bmedium Gemini 3.5 FlashnonevsQwen3.6 35B A3Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.6 35B A3Bmedium Gemini 3.1 Flash LitelowvsQwen3.6 35B A3Bmedium Qwen3.5-35B-A3BmediumvsGLM 5none Gemma 4 31Bmedium免费可用vsGLM 5none Nemotron 3 Supermedium免费可用vsGLM 5none Qwen3.6 35B A3BmediumvsStep 3.7 Flashhigh