AI BENCHY Compare

Grok 4.20 Beta vs Z.ai: GLM 5V Turbo

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-04-02

Metrik	Grok 4.20 Beta Grok 4.20 Beta medium Rilis: 2026-03-12	GLM 5V Turbo GLM 5V Turbo medium Rilis: 2026-04-01

Metrik	Grok 4.20 Beta Grok 4.20 Beta medium Rilis: 2026-03-12	GLM 5V Turbo GLM 5V Turbo medium Rilis: 2026-04-01
Skor	7.9	7.7
Peringkat	#26	#30
Konsistensi	9.0	7.4
Tes benar
Tingkat lulus per percobaan	72.6%	76.5%
Tes tidak stabil	2	6
Total Run	51	51
Biaya per hasil	5.525	2.697
Total Biaya	$0.608	$0.270
Harga input	$0.000 / 1M	$1.200 / 1M
Harga output	$0.000 / 1M	$4.000 / 1M
Token output	1,487	1,947
Token penalaran	87,922	54,313
Waktu respons (rata-rata)	8.54s	15.03s
Waktu respons (maks)	24.21s	67.08s
Waktu respons (total)	145.26s	255.55s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	8.7	7.9	91.7%	1		3.16s	268	7,583
GLM 5V Turbo	7.2	6.1	75.0%	2		10.76s	587	7,872

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	10.0	10.0	100.0%	0		20.93s	227	12,212
GLM 5V Turbo	6.9	3.8	66.7%	1		15.06s	403	2,523

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	10.0	10.0	100.0%	0		4.01s	180	5,281
GLM 5V Turbo	10.0	10.0	100.0%	0		9.60s	236	4,333

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	5.3	10.0	33.3%	0		21.33s	251	40,255
GLM 5V Turbo	5.3	7.2	44.4%	1		38.15s	32	29,035

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	10.0	10.0	100.0%	0		5.78s	72	3,440
GLM 5V Turbo	10.0	10.0	100.0%	0		11.09s	131	2,183

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	8.3	10.0	50.0%	0		4.97s	57	7,107
GLM 5V Turbo	9.9	10.0	100.0%	0		3.74s	72	1,813

Puzzle Solving	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	8.2	7.2	88.9%	1		3.85s	249	6,660
GLM 5V Turbo	7.7	7.3	77.8%	1		10.91s	193	5,789

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	3.0	10.0	0.0%	0		12.39s	183	5,384
GLM 5V Turbo	7.0	3.7	66.7%	1		12.53s	293	765

Perbandingan Cepat

Ganti Pasangan Perbandingan

Gemini 3.1 Flash Lite PreviewnonevsGrok 4.20 Betamedium Gemini 3 Flash PreviewnonevsGrok 4.20 Betamedium GPT-5.2 ChatnonevsGLM 5V Turbomedium GPT-5.2 ChatnonevsGrok 4.20 Betamedium Gemini 3.1 Flash Lite PreviewlowvsGrok 4.20 Betamedium Gemini 3.1 Flash Lite PreviewnonevsGLM 5V Turbomedium GPT-5.3 ChatnonevsGLM 5V Turbomedium Gemini 3 Flash PreviewnonevsGLM 5V Turbomedium Gemini 3.1 Flash Lite PreviewlowvsGLM 5V Turbomedium GPT-5.3 ChatnonevsGrok 4.20 Betamedium Claude Sonnet 4.6nonevsGLM 5V Turbomedium Claude Sonnet 4.6nonevsGrok 4.20 Betamedium