Navigasi
AI BENCHY
Your ad here

AI BENCHY Compare

xAI: Grok 4.20 Multi-Agent Beta vs Z.ai: GLM 5

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-03-17

Metrik Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Rilis: 2026-03-12 GLM 5 GLM 5 none Rilis: 2026-02-12
Peringkat #44 #40
Skor 6.2 6.7
Konsistensi 7.2 10.0
Biaya per hasil 82.962 0.201
Total Biaya $4.978 $0.019
Tes benar
Tingkat lulus per percobaan 54.9% 52.9%
Tes tidak stabil 6 0
Total Run 51 51
Token output 298,948 1,551
Token penalaran 296,529 0
Waktu respons (rata-rata) 8.64s 3.77s
Waktu respons (maks) 35.28s 11.07s
Waktu respons (total) 129.64s 37.66s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Grok 4.20 Multi-Agent Beta 6.9 5.8 75.0% 2 3.46s 33,706 33,077
GLM 5 4.8 10.0 25.0% 0 2.37s 275 0
Gabungan Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Grok 4.20 Multi-Agent Beta 3.0 10.0 0.0% 0 0ms 0 0
GLM 5 3.0 10.0 0.0% 0 4.98s 406 0
Parsing dan ekstraksi data Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Grok 4.20 Multi-Agent Beta 10.0 10.0 100.0% 0 5.54s 25,306 25,051
GLM 5 10.0 10.0 100.0% 0 5.78s 203 0
Spesifik domain Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Grok 4.20 Multi-Agent Beta 2.9 7.2 11.1% 1 24.67s 164,609 163,647
GLM 5 3.0 10.0 0.0% 0 2.24s 19 0
Kecerdasan umum Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Grok 4.20 Multi-Agent Beta 5.8 2.8 66.7% 1 6.40s 15,848 15,746
GLM 5 10.0 10.0 100.0% 0 3.27s 103 0
Kepatuhan instruksi Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Grok 4.20 Multi-Agent Beta 8.3 10.0 50.0% 0 4.63s 25,457 25,322
GLM 5 10.0 10.0 100.0% 0 1.48s 61 0
Puzzle Solving Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Grok 4.20 Multi-Agent Beta 7.2 5.1 77.8% 2 5.01s 34,022 33,686
GLM 5 7.7 10.0 66.7% 0 2.05s 264 0
Pemanggilan alat Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Grok 4.20 Multi-Agent Beta 3.0 10.0 0.0% 0 0ms 0 0
GLM 5 10.0 10.0 100.0% 0 11.07s 220 0

Perbandingan Cepat

Ganti Pasangan Perbandingan