AI BENCHY Compare

xAI: Grok 4.20 Multi-Agent Beta vs Z.ai: GLM 5 Turbo

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-15

Metrică	Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lansare: 2026-03-12	GLM 5 Turbo GLM 5 Turbo none Lansare: 2026-03-15

Metrică	Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lansare: 2026-03-12	GLM 5 Turbo GLM 5 Turbo none Lansare: 2026-03-15
Rang	#47	#53
Scor	6.0	5.7
Consistență	7.1	9.5
Cost per rezultat	97.178	0.467
Cost total	$4.859	$0.028
Teste corecte
Rată de trecere pe încercare	52.1%	39.6%
Teste instabile	6	1
Rulări totale	48	48
Tokenuri de ieșire	293,634	1,264
Tokenuri de raționament	291,260	0
Timp de răspuns (mediu)	9.08s	2.92s
Timp de răspuns (maxim)	35.28s	8.21s
Timp de răspuns (total)	127.09s	46.72s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20 Multi-Agent Beta	5.8	4.4	66.7%	2		3.77s	28,392	27,808
GLM 5 Turbo	3.0	10.0	0.0%	0		3.01s	376	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20 Multi-Agent Beta	3.0	10.0	0.0%	0		0ms	0	0
GLM 5 Turbo	3.0	10.0	0.0%	0		4.89s	144	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20 Multi-Agent Beta	10.0	10.0	100.0%	0		5.54s	25,306	25,051
GLM 5 Turbo	10.0	10.0	100.0%	0		2.47s	204	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20 Multi-Agent Beta	2.9	7.2	11.1%	1		24.67s	164,609	163,647
GLM 5 Turbo	5.3	10.0	33.3%	0		1.97s	25	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20 Multi-Agent Beta	5.8	2.8	66.7%	1		6.40s	15,848	15,746
GLM 5 Turbo	4.2	9.9	0.0%	0		2.18s	48	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20 Multi-Agent Beta	8.3	10.0	50.0%	0		4.63s	25,457	25,322
GLM 5 Turbo	6.5	10.0	50.0%	0		2.13s	65	0

Puzzle Solving	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20 Multi-Agent Beta	7.2	5.1	77.8%	2		5.01s	34,022	33,686
GLM 5 Turbo	5.5	7.4	44.4%	1		2.43s	180	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20 Multi-Agent Beta	3.0	10.0	0.0%	0		0ms	0	0
GLM 5 Turbo	10.0	10.0	100.0%	0		8.21s	222	0

Comparație rapidă

Schimbă perechea de comparație

Qwen3.5-35B-A3BnonevsGrok 4.20 Multi-Agent Betamedium Hunter AlphanonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-122B-A10BnonevsGrok 4.20 Multi-Agent Betamedium Gemini 2.5 FlashnonevsGrok 4.20 Multi-Agent Betamedium Seed-2.0-LitenonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-FlashnonevsGrok 4.20 Multi-Agent Betamedium MiniMax M2.5mediumDisponibil gratuitvsGLM 5 Turbonone GPT-5.4nonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-27BnonevsGrok 4.20 Multi-Agent Betamedium gpt-oss-120bmediumDisponibil gratuitvsGLM 5 Turbonone DeepSeek V3.2nonevsGrok 4.20 Multi-Agent Betamedium Kimi K2.5nonevsGrok 4.20 Multi-Agent Betamedium