AI BENCHY Compare

Qwen: Qwen3.6 Max Preview vs Z.ai: GLM 5.2

概要

Qwen3.6 Max Preview vs GLM 5.2 の benchmark 比較: Qwen3.6 Max Preview が平均スコアでリードし、8.9 vs 8.7 です。 GLM 5.2 の benchmark コストが低く、$0.324 vs $0.960 です。 GLM 5.2 の方が高速で、23.28s vs 59.63s です、成功率は 81.0% vs 84.1% です。

おすすめモデル: GLM 5.2 - スコアはここでの最高値に近く（8.7 vs 8.9）、Qwen3.6 Max Preview より約 3.0 倍低コストです。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-17

指標	Qwen3.6 Max Preview Qwen3.6 Max Preview medium リリース: 2026-04-20	GLM 5.2 GLM 5.2 medium リリース: 2026-06-17

指標	Qwen3.6 Max Preview Qwen3.6 Max Preview medium リリース: 2026-04-20	GLM 5.2 GLM 5.2 medium リリース: 2026-06-17
スコア	8.9	8.7
順位	#11	#14
信頼性	10.0	9.5
一貫性	9.3	8.4
正解テスト
試行ごとの合格率	81.0%	84.1%
不安定なテスト	2	4
総実行回数	63	63
結果あたりのコスト	7.024	2.159
合計コスト	$0.960	$0.324
入力価格	$1.040 / 1M	$1.400 / 1M
出力価格	$6.240 / 1M	$4.400 / 1M
合計入力トークン	42,362	37,199
出力トークン	2,273	12,261
推論トークン	144,367	49,500
応答時間（平均）	59.63s	23.28s
応答時間（最大）	238.07s	101.36s
応答時間（合計）	1252.17s	488.94s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#11 Qwen3.6 Max Preview

medium

Cost: $0.024
Time: 76.5s
Tokens: 3,861 tok

#14 GLM 5.2

medium

Cost: $0.041
Time: 195.8s
Tokens: 9,287 tok

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		22.13s	672	228	10,075
GLM 5.2	10.0	10.0	100.0%	0		5.89s	639	497	2,634

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	8.8	7.8	88.9%	1		146.48s	7,895	427	52,957
GLM 5.2	8.2	7.2	88.9%	1		40.96s	7,317	1,475	17,123

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		121.49s	14,934	390	14,575
GLM 5.2	10.0	10.0	100.0%	0		51.96s	12,696	458	4,531

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		41.15s	7,782	270	10,106
GLM 5.2	10.0	10.0	100.0%	0		13.44s	7,149	348	2,345

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	2.9	7.2	11.1%	1		95.91s	771	60	30,371
GLM 5.2	4.1	4.4	44.5%	2		45.47s	551	8,188	11,606

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		32.24s	516	129	3,510
GLM 5.2	10.0	10.0	100.0%	0		17.39s	498	54	1,842

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		24.31s	699	103	5,848
GLM 5.2	9.9	10.0	100.0%	0		7.90s	678	94	1,518

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		24.32s	696	329	7,693
GLM 5.2	8.2	7.2	88.9%	1		13.13s	672	536	4,822

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		18.32s	8,193	309	1,571
GLM 5.2	10.0	10.0	100.0%	0		20.41s	6,861	230	550

雑学	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Qwen3.6 Max Preview	3.0	10.0	0.0%	0		60.56s	204	28	7,661
GLM 5.2	3.0	10.0	0.0%	0		34.25s	138	381	2,529

クイック比較

比較ペアを切り替え

GPT-5.2 ChatnonevsGLM 5.2medium Gemini 3.5 FlashlowvsQwen3.6 Max Previewmedium GPT-5.2 ChatnonevsQwen3.6 Max Previewmedium DeepSeek V4 FlashhighvsGLM 5.2medium GPT-5.5lowvsQwen3.6 Max Previewmedium Gemini 3.5 FlashlowvsGLM 5.2medium DeepSeek V4 FlashhighvsQwen3.6 Max Previewmedium GPT-5.5lowvsGLM 5.2medium Gemini 3.5 FlashhighvsQwen3.6 Max Previewmedium Step 3.7 FlashlowvsGLM 5.2medium DeepSeek V4 ProhighvsGLM 5.2medium GPT-5.3 ChatnonevsGLM 5.2medium