AI BENCHY Compare

xAI: Grok Build 0.1 vs Z.ai: GLM 5.1

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-22

Metrică	Grok Build 0.1 Grok Build 0.1 medium Lansare: 2026-05-21	GLM 5.1 GLM 5.1 medium Lansare: 2026-04-07

Metrică	Grok Build 0.1 Grok Build 0.1 medium Lansare: 2026-05-21	GLM 5.1 GLM 5.1 medium Lansare: 2026-04-07
Scor	7.6	7.4
Rang	#45	#51
Fiabilitate	10.0	3.3
Consistență	8.5	8.3
Teste corecte
Rată de trecere pe încercare	70.0%	71.7%
Teste instabile	4	4
Rulări totale	60	60
Cost per rezultat	5.271	2.379
Cost total	$0.633	$0.286
Preț de intrare	$1.000 / 1M	$0.980 / 1M
Preț de ieșire	$2.000 / 1M	$3.080 / 1M
Tokenuri de ieșire	2,167	11,475
Tokenuri de raționament	293,436	71,876
Timp de răspuns (mediu)	26.36s	32.22s
Timp de răspuns (maxim)	103.89s	172.60s
Timp de răspuns (total)	527.19s	612.25s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	10.0	10.0	100.0%	0		5.46s	195	9,825
GLM 5.1	10.0	10.0	100.0%	0		8.31s	401	5,122

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	5.3	2.9	50.0%	2		67.43s	574	87,798
GLM 5.1	4.7	1.6	66.7%	2		145.56s	4,727	34,384

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	10.0	10.0	100.0%	0		30.81s	231	18,779
GLM 5.1	9.5	10.0	100.0%	0		43.11s	327	4,206

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	10.0	10.0	100.0%	0		7.76s	180	10,343
GLM 5.1	10.0	10.0	100.0%	0		9.33s	991	4,552

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	5.3	10.0	33.3%	0		77.75s	501	111,807
GLM 5.1	5.3	10.0	33.3%	0		29.77s	969	11,314

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	3.8	2.5	33.3%	1		10.14s	78	5,386
GLM 5.1	10.0	10.0	100.0%	0		20.95s	2,875	2,875

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	9.8	10.0	100.0%	0		9.62s	57	12,436
GLM 5.1	6.4	5.8	66.7%	1		7.47s	204	1,617

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	6.2	7.5	55.6%	1		8.67s	161	15,476
GLM 5.1	8.2	7.2	88.9%	1		23.85s	899	5,627

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	10.0	10.0	100.0%	0		9.40s	180	5,319
GLM 5.1	3.0	10.0	0.0%	0		0ms	0	0

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok Build 0.1	3.0	10.0	0.0%	0		26.07s	10	16,267
GLM 5.1	3.0	10.0	0.0%	0		29.40s	82	2,179

Comparație rapidă

Schimbă perechea de comparație

Gemini 3.1 Flash LitelowvsGLM 5.1medium GPT-5.3 ChatnonevsGLM 5.1medium DeepSeek V4 FlashhighDisponibil gratuitvsGLM 5.1medium Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium GPT-5.2 ChatnonevsGrok Build 0.1medium Gemini 3.1 Flash Lite PreviewlowvsGrok Build 0.1medium Gemini 3 Flash PreviewnonevsGrok Build 0.1medium Gemini 3.1 Flash Lite PreviewnonevsGrok Build 0.1medium Gemini 3.1 Flash LitelowvsGrok Build 0.1medium GPT-5.3 ChatnonevsGrok Build 0.1medium Ring-2.6-1TnonevsGLM 5.1medium DeepSeek V4 FlashhighDisponibil gratuitvsGrok Build 0.1medium