AI BENCHY Compare

xAI: Grok 4.3 vs Z.ai: GLM 5

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-05-01

Metriek	Grok 4.3 Grok 4.3 medium Releasedatum: 2026-05-01	GLM 5 GLM 5 medium Releasedatum: 2026-02-12

Metriek	Grok 4.3 Grok 4.3 medium Releasedatum: 2026-05-01	GLM 5 GLM 5 medium Releasedatum: 2026-02-12
Score	8.2	8.4
Rang	#20	#18
Betrouwbaarheid	10.0	n.v.t.
Consistentie	8.6	8.2
Correcte tests
Slaagpercentage per poging	81.5%	85.2%
Instabiele tests	3	4
Totaal runs	54	54
Kosten per resultaat	3.974	1.188
Totale kosten	$0.517	$0.155
Invoerprijs	$1.250 / 1M	$0.600 / 1M
Uitvoerprijs	$2.500 / 1M	$2.080 / 1M
Uitvoer-tokens	1,223	20,163
Redeneer-tokens	187,047	58,337
Responstijd (gem.)	48.63s	23.34s
Responstijd (max)	216.69s	79.09s
Responstijd (totaal)	875.27s	233.40s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	10.0	10.0	100.0%	0		8.83s	88	8,207
GLM 5	10.0	10.0	100.0%	0		23.66s	480	7,056

Programmeren	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	10.0	10.0	100.0%	0		45.72s	284	9,659
GLM 5	10.0	10.0	100.0%	0		79.09s	330	19,814

Gecombineerd	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	10.0	10.0	100.0%	0		63.99s	234	15,301
GLM 5	10.0	10.0	100.0%	0		28.96s	662	3,242

Gegevensparsering en extractie	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	10.0	10.0	100.0%	0		18.97s	180	9,546
GLM 5	7.1	5.6	83.3%	1		8.90s	567	3,734

Domeinspecifiek	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	5.3	7.2	44.4%	1		181.74s	14	111,300
GLM 5	3.5	4.4	33.3%	2		0ms	13,176	14,137

Algemene intelligentie	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	5.4	2.5	66.7%	1		24.70s	70	5,020
GLM 5	6.1	3.1	66.7%	1		14.69s	2,020	2,248

Instructies opvolgen	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	9.8	10.0	100.0%	0		18.58s	57	8,713
GLM 5	10.0	10.0	100.0%	0		7.25s	1,001	2,129

Puzzeloplossing	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	5.9	7.2	55.6%	1		22.53s	128	14,686
GLM 5	10.0	10.0	100.0%	0		15.64s	1,694	4,983

Toolaanroepen	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
Grok 4.3	10.0	10.0	100.0%	0		17.66s	168	4,615
GLM 5	10.0	10.0	100.0%	0		15.93s	233	994

Snelle vergelijking

Vergelijkingspaar wisselen

HY3 PreviewlowGratis beschikbaarvsGrok 4.3medium Gemini 3 Flash PreviewnonevsGrok 4.3medium Gemini 3.1 Flash Lite PreviewlowvsGrok 4.3medium HY3 PreviewhighGratis beschikbaarvsGLM 5medium HY3 PreviewlowGratis beschikbaarvsGLM 5medium Gemini 3 Flash PreviewnonevsGLM 5medium Gemini 3.1 Flash Lite PreviewlowvsGLM 5medium GPT-5.2 ChatnonevsGrok 4.3medium Gemini 3.1 Flash Lite PreviewnonevsGrok 4.3medium GPT-5.3 ChatnonevsGrok 4.3medium HY3 PreviewhighGratis beschikbaarvsGrok 4.3medium DeepSeek V4 FlashhighvsGrok 4.3medium