AI BENCHY Compare

xAI: Grok 4.20 vs Z.ai: GLM 5.2

Résumé

Comparaison benchmark Grok 4.20 vs GLM 5.2 : Grok 4.20 mène au score moyen avec 7.3 vs 7.1. GLM 5.2 a le coût de benchmark le plus bas avec $0.076 vs $0.609. GLM 5.2 est plus rapide avec 6.34s vs 27.68s, avec des taux de réussite de 63.5% vs 60.3%.

Modèle recommandé: GLM 5.2 - Son score reste proche du meilleur score ici (7.1 vs 7.3) tout en coûtant environ 8.1x moins que Grok 4.20.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-06-17

Métrique	Grok 4.20 Grok 4.20 medium Sortie: 2026-03-31	GLM 5.2 GLM 5.2 none Sortie: 2026-06-17

Métrique	Grok 4.20 Grok 4.20 medium Sortie: 2026-03-31	GLM 5.2 GLM 5.2 none Sortie: 2026-06-17
Score	7.3	7.1
Rang	#53	#61
Fiabilité	10.0	9.9
Cohérence	8.8	9.6
Tests corrects
Taux de réussite par tentative	63.5%	60.3%
Tests instables	3	1
Exécutions totales	63	63
Coût par résultat	8.309	0.628
Coût total	$0.609	$0.076
Prix d'entrée	$1.250 / 1M	$1.400 / 1M
Prix de sortie	$2.500 / 1M	$4.400 / 1M
Total des jetons d'entrée	44,433	38,671
Jetons de sortie	1,819	4,817
Jetons de raisonnement	219,524	0
Temps de réponse (moy.)	27.68s	6.34s
Temps de réponse (max)	199.66s	20.69s
Temps de réponse (total)	581.26s	133.19s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#53 xAI: Grok 4.20

medium

Cost: $0.041
Time: 110.3s
Tokens: 16,336 tok

#61 GLM 5.2

none

Invalid SVG

Cost: $0.033
Time: 87.7s
Tokens: 7,455 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	8.2	7.9	83.3%	1		3.95s	2,010	287	8,312
GLM 5.2	8.3	10.0	75.0%	0		3.70s	567	313	0

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	6.3	6.6	55.6%	1		109.93s	8,307	268	103,150
GLM 5.2	3.7	9.5	0.0%	0		7.55s	7,263	1,958	0

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	10.0	10.0	100.0%	0		17.40s	12,909	232	9,556
GLM 5.2	10.0	10.0	100.0%	0		20.69s	14,296	1,489	0

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	10.0	10.0	100.0%	0		4.17s	7,761	180	5,333
GLM 5.2	10.0	10.0	100.0%	0		7.17s	7,113	204	0

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	5.3	10.0	33.3%	0		27.03s	1,764	375	49,339
GLM 5.2	5.3	10.0	33.3%	0		6.50s	696	27	0

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	3.9	2.6	33.3%	1		24.48s	825	65	6,440
GLM 5.2	6.1	3.1	66.7%	1		4.42s	480	82	0

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	9.8	10.0	100.0%	0		4.26s	1,362	57	6,419
GLM 5.2	9.8	10.0	100.0%	0		3.84s	642	66	0

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	7.7	10.0	66.7%	0		6.22s	1,689	149	7,913
GLM 5.2	7.7	10.0	66.7%	0		3.31s	618	265	0

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	3.0	10.0	0.0%	0		13.68s	7,275	197	6,620
GLM 5.2	10.0	10.0	100.0%	0		15.76s	6,807	400	0

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Grok 4.20	3.0	10.0	0.0%	0		63.48s	531	9	16,442
GLM 5.2	3.0	10.0	0.0%	0		3.41s	189	13	0

Comparaison rapide

Changer la paire de comparaison

Gemini 3 Flash PreviewlowvsGrok 4.20medium Gemma 4 26B A4BmediumDisponible gratuitementvsGLM 5.2none Claude Sonnet 4.6nonevsGrok 4.20medium MiMo-V2-FlashmediumvsGLM 5.2none Step 3.7 FlashhighvsGLM 5.2none Claude Opus 4.8nonevsGrok 4.20medium Kimi K2.7 CodemediumvsGLM 5.2none GPT-5.3 ChatnonevsGrok 4.20medium DeepSeek V4 PrononevsGrok 4.20medium Qwen3.7 PlusnonevsGrok 4.20medium Gemini 3 Flash PreviewlowvsGLM 5.2none Step 3.7 FlashhighvsGrok 4.20medium