AI BENCHY Compare

Qwen: Qwen3.7 Plus vs Z.ai: GLM 5

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-03

Metrik	Qwen3.7 Plus Qwen3.7 Plus medium Rilis: 2026-06-03	GLM 5 GLM 5 medium Rilis: 2026-02-12

Metrik	Qwen3.7 Plus Qwen3.7 Plus medium Rilis: 2026-06-03	GLM 5 GLM 5 medium Rilis: 2026-02-12
Skor	8.4	8.2
Peringkat	#16	#18
Keandalan	9.9	10.0
Konsistensi	9.2	8.4
Tes benar
Tingkat lulus per percobaan	80.0%	81.7%
Tes tidak stabil	2	4
Total Run	60	60
Biaya per hasil	1.324	1.676
Total Biaya	$0.199	$0.212
Harga input	$0.400 / 1M	$0.600 / 1M
Harga output	$1.600 / 1M	$1.920 / 1M
Total token input	38,104	32,626
Token output	2,107	21,558
Token penalaran	112,479	95,772
Waktu respons (rata-rata)	36.84s	32.67s
Waktu respons (maks)	178.04s	99.85s
Waktu respons (total)	736.86s	392.01s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	10.0	10.0	100.0%	0		8.58s	672	195	5,065
GLM 5	10.0	10.0	100.0%	0		23.66s	555	480	7,056

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	6.5	5.9	66.7%	1		122.40s	3,637	396	30,301
GLM 5	10.0	10.0	100.0%	0		89.47s	4,656	2,985	45,706

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	10.0	10.0	100.0%	0		65.24s	14,934	366	10,132
GLM 5	10.0	10.0	100.0%	0		28.96s	12,804	662	3,242

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	10.0	10.0	100.0%	0		21.75s	7,782	270	6,713
GLM 5	7.1	5.6	83.3%	1		8.90s	5,508	567	3,734

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	3.6	7.2	22.2%	1		45.35s	771	57	27,073
GLM 5	3.5	4.4	33.3%	2		0ms	260	13,176	14,137

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	10.0	10.0	100.0%	0		25.48s	516	123	3,998
GLM 5	6.1	3.1	66.7%	1		14.69s	477	2,020	2,248

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.13s	699	102	5,013
GLM 5	10.0	10.0	100.0%	0		7.25s	636	1,001	2,129

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.38s	696	280	7,312
GLM 5	10.0	10.0	100.0%	0		11.33s	609	33	4,076

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	10.0	10.0	100.0%	0		15.02s	8,193	292	1,831
GLM 5	10.0	10.0	100.0%	0		15.93s	6,935	233	994

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.7 Plus	3.0	10.0	0.0%	0		91.07s	204	26	15,041
GLM 5	3.0	10.0	0.0%	0		67.37s	186	401	12,450

Perbandingan Cepat

Ganti Pasangan Perbandingan

Gemini 3.5 FlashnonevsGLM 5medium Gemini 3.5 FlashminimalvsGLM 5medium Gemini 3 Flash PreviewlowvsQwen3.7 Plusmedium Qwen3.7 MaxnonevsGLM 5medium Gemini 3.5 FlashnonevsQwen3.7 Plusmedium GPT-5.2 ChatnonevsGLM 5medium Gemini 3.5 FlashminimalvsQwen3.7 Plusmedium Gemini 3 Flash PreviewlowvsGLM 5medium GPT-5.2 ChatnonevsQwen3.7 Plusmedium Gemini 3 Flash PreviewnonevsGLM 5medium DeepSeek V4 FlashhighvsGLM 5medium Gemini 3.1 Flash Lite PreviewlowvsGLM 5medium