AI BENCHY Compare

xAI: Grok 4.20 vs Z.ai: GLM 5V Turbo

Rezumat

Comparație benchmark Grok 4.20 vs GLM 5V Turbo: Grok 4.20 conduce la scorul mediu cu 7.3 vs 7.3. GLM 5V Turbo are costul de benchmark mai mic, $0.457 vs $0.609. GLM 5V Turbo este mai rapid cu 23.08s vs 27.68s, cu rate de reușită de 63.5% vs 68.3%.

Model recomandat: GLM 5V Turbo - Oferă cel mai bun compromis per total: scor competitiv (7.3), cost mai mic decât Grok 4.20 și timp de răspuns echilibrat.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-18

Metrică	Grok 4.20 Grok 4.20 medium Lansare: 2026-03-31	GLM 5V Turbo GLM 5V Turbo medium Lansare: 2026-04-01

Metrică	Grok 4.20 Grok 4.20 medium Lansare: 2026-03-31	GLM 5V Turbo GLM 5V Turbo medium Lansare: 2026-04-01
Scor	7.3	7.3
Rang	#53	#56
Fiabilitate	10.0	10.0
Consistență	8.8	7.9
Teste corecte
Rată de trecere pe încercare	63.5%	68.3%
Teste instabile	3	6
Rulări totale	63	63
Cost per rezultat	8.309	4.151
Cost total	$0.609	$0.457
Preț de intrare	$1.250 / 1M	$1.200 / 1M
Preț de ieșire	$2.500 / 1M	$4.000 / 1M
Total tokenuri de intrare	44,433	44,615
Tokenuri de ieșire	1,819	2,347
Tokenuri de raționament	219,524	98,415
Timp de răspuns (mediu)	27.68s	23.08s
Timp de răspuns (maxim)	199.66s	95.88s
Timp de răspuns (total)	581.26s	484.63s

Prezentare generare

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#53 xAI: Grok 4.20

medium

Cost: $0.041
Timp: 110.3s
Tokenuri: 16,336 tok

#56 GLM 5V Turbo

medium

SVG invalid

Cost: $0.000
Timp: 300.0s
Tokenuri: 0 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	8.2	7.9	83.3%	1		3.95s	2,010	287	8,312
GLM 5V Turbo	7.2	6.1	75.0%	2		10.76s	555	587	7,872

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	6.3	6.6	55.6%	1		109.93s	8,307	268	103,150
GLM 5V Turbo	6.0	7.2	55.6%	1		63.38s	7,256	440	37,873

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	10.0	10.0	100.0%	0		17.40s	12,909	232	9,556
GLM 5V Turbo	6.9	3.8	66.7%	1		15.06s	18,533	403	2,523

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	10.0	10.0	100.0%	0		4.17s	7,761	180	5,333
GLM 5V Turbo	10.0	10.0	100.0%	0		9.60s	7,107	236	4,333

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	5.3	10.0	33.3%	0		27.03s	1,764	375	49,339
GLM 5V Turbo	5.3	7.2	44.4%	1		38.15s	687	32	29,035

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	3.9	2.6	33.3%	1		24.48s	825	65	6,440
GLM 5V Turbo	10.0	10.0	100.0%	0		11.09s	477	131	2,183

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	9.8	10.0	100.0%	0		4.26s	1,362	57	6,419
GLM 5V Turbo	9.9	10.0	100.0%	0		3.74s	636	72	1,813

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	7.7	10.0	66.7%	0		6.22s	1,689	149	7,913
GLM 5V Turbo	7.7	10.0	66.7%	0		10.24s	609	131	4,496

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	3.0	10.0	0.0%	0		13.68s	7,275	197	6,620
GLM 5V Turbo	7.0	3.7	66.7%	1		12.53s	8,569	293	765

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Grok 4.20	3.0	10.0	0.0%	0		63.48s	531	9	16,442
GLM 5V Turbo	3.0	10.0	0.0%	0		40.96s	186	22	7,522

Comparație rapidă

Schimbă perechea de comparație

Gemini 3 Flash PreviewlowvsGrok 4.20medium Claude Sonnet 4.6nonevsGrok 4.20medium Claude Opus 4.8nonevsGrok 4.20medium GPT-5.3 ChatnonevsGrok 4.20medium DeepSeek V4 PrononevsGrok 4.20medium Qwen3.7 PlusnonevsGrok 4.20medium Grok 4.20mediumvsGLM 5.2none Step 3.7 FlashhighvsGrok 4.20medium DeepSeek V4 ProhighvsGrok 4.20medium Step 3.7 FlashlowvsGrok 4.20medium Gemini 3.5 FlashnonevsGrok 4.20medium Gemini 3 Flash PreviewnonevsGrok 4.20medium