AI BENCHY Compare

Google: Gemma 4 31B vs Z.ai: GLM 5

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-05-19

Metrik	Gemma 4 31B Gemma 4 31B medium Veröffentlichung: 2026-04-02 Kostenlos verfügbar	GLM 5 GLM 5 medium Veröffentlichung: 2026-02-12

Metrik	Gemma 4 31B Gemma 4 31B medium Veröffentlichung: 2026-04-02 Kostenlos verfügbar	GLM 5 GLM 5 medium Veröffentlichung: 2026-02-12
Punktzahl	8.2	8.1
Rang	#18	#24
Zuverlässigkeit	6.7	10.0
Konsistenz	9.6	8.3
Korrekte Tests
Erfolgsquote pro Versuch	77.2%	80.7%
Instabile Tests	1	4
Gesamtläufe	57	57
Kosten pro Ergebnis	0.158	1.379
Gesamtkosten	$0.023	$0.180
Eingabepreis	$0.120 / 1M	$0.600 / 1M
Ausgabepreis	$0.370 / 1M	$1.920 / 1M
Ausgabe-Token	14,426	20,564
Denk-Token	37,964	70,787
Antwortzeit (Durchschnitt)	28.72s	27.34s
Antwortzeit (Maximum)	90.14s	79.09s
Antwortzeit (Gesamt)	488.27s	300.78s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	10.0	10.0	100.0%	0		12.89s	962	2,046
GLM 5	10.0	10.0	100.0%	0		23.66s	480	7,056

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	4.7	1.6	66.7%	1		70.97s	3,166	5,449
GLM 5	10.0	10.0	100.0%	0		79.09s	330	19,814

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0
GLM 5	10.0	10.0	100.0%	0		28.96s	662	3,242

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	10.0	10.0	100.0%	0		21.11s	1,822	2,951
GLM 5	7.1	5.6	83.3%	1		8.90s	567	3,734

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	7.7	10.0	66.7%	0		38.48s	4,349	8,985
GLM 5	3.5	4.4	33.3%	2		0ms	13,176	14,137

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	10.0	10.0	100.0%	0		9.57s	105	888
GLM 5	6.1	3.1	66.7%	1		14.69s	2,020	2,248

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	10.0	10.0	100.0%	0		12.76s	533	2,035
GLM 5	10.0	10.0	100.0%	0		7.25s	1,001	2,129

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	9.9	10.0	100.0%	0		27.63s	1,797	5,596
GLM 5	10.0	10.0	100.0%	0		15.64s	1,694	4,983

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0
GLM 5	10.0	10.0	100.0%	0		15.93s	233	994

Allgemeinwissen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Gemma 4 31B	3.0	10.0	0.0%	0		90.14s	1,692	10,014
GLM 5	3.0	10.0	0.0%	0		67.37s	401	12,450

Schnellvergleich

Vergleichspaar wechseln

Gemini 3.5 FlashminimalvsGLM 5medium Gemini 3 Flash PreviewnonevsGLM 5medium Gemini 3.1 Flash Lite PreviewlowvsGLM 5medium Gemini 3.1 Flash Lite PreviewnonevsGLM 5medium GPT-5.2 ChatnonevsGLM 5medium Gemini 3.1 Flash LitelowvsGLM 5medium GPT-5.3 ChatnonevsGLM 5medium DeepSeek V4 FlashhighKostenlos verfügbarvsGLM 5medium Gemma 4 31BmediumKostenlos verfügbarvsGPT-5.2 Chatnone Gemma 4 31BmediumKostenlos verfügbarvsGPT-5.5low Gemma 4 31BmediumKostenlos verfügbarvsGPT-5.3 Chatnone DeepSeek V4 FlashhighKostenlos verfügbarvsGemma 4 31BmediumKostenlos verfügbar