AI BENCHY Compare

xAI: Grok 4.20 Multi-Agent Beta vs Z.ai: GLM 5

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-03-17

Métrique	Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Sortie: 2026-03-12	GLM 5 GLM 5 none Sortie: 2026-02-12

Métrique	Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Sortie: 2026-03-12	GLM 5 GLM 5 none Sortie: 2026-02-12
Rang	#44	#40
Score	6.2	6.7
Cohérence	7.2	10.0
Coût par résultat	82.962	0.201
Coût total	$4.978	$0.019
Tests corrects
Taux de réussite par tentative	54.9%	52.9%
Tests instables	6	0
Exécutions totales	51	51
Jetons de sortie	298,948	1,551
Jetons de raisonnement	296,529	0
Temps de réponse (moy.)	8.64s	3.77s
Temps de réponse (max)	35.28s	11.07s
Temps de réponse (total)	129.64s	37.66s

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Grok 4.20 Multi-Agent Beta	6.9	5.8	75.0%	2		3.46s	33,706	33,077
GLM 5	4.8	10.0	25.0%	0		2.37s	275	0

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Grok 4.20 Multi-Agent Beta	3.0	10.0	0.0%	0		0ms	0	0
GLM 5	3.0	10.0	0.0%	0		4.98s	406	0

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Grok 4.20 Multi-Agent Beta	10.0	10.0	100.0%	0		5.54s	25,306	25,051
GLM 5	10.0	10.0	100.0%	0		5.78s	203	0

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Grok 4.20 Multi-Agent Beta	2.9	7.2	11.1%	1		24.67s	164,609	163,647
GLM 5	3.0	10.0	0.0%	0		2.24s	19	0

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Grok 4.20 Multi-Agent Beta	5.8	2.8	66.7%	1		6.40s	15,848	15,746
GLM 5	10.0	10.0	100.0%	0		3.27s	103	0

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Grok 4.20 Multi-Agent Beta	8.3	10.0	50.0%	0		4.63s	25,457	25,322
GLM 5	10.0	10.0	100.0%	0		1.48s	61	0

Puzzle Solving	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Grok 4.20 Multi-Agent Beta	7.2	5.1	77.8%	2		5.01s	34,022	33,686
GLM 5	7.7	10.0	66.7%	0		2.05s	264	0

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Grok 4.20 Multi-Agent Beta	3.0	10.0	0.0%	0		0ms	0	0
GLM 5	10.0	10.0	100.0%	0		11.07s	220	0

Comparaison rapide

Changer la paire de comparaison

GPT-5 MinimediumvsGLM 5none DeepSeek V3.2nonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-FlashnonevsGrok 4.20 Multi-Agent Betamedium Nemotron 3 Super 120b A12bmediumDisponible gratuitementvsGLM 5none Grok 4.1 FastmediumvsGLM 5none Hunter AlphamediumvsGLM 5none Seed-2.0-LitenonevsGrok 4.20 Multi-Agent Betamedium Gemini 2.5 FlashnonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-35B-A3BnonevsGrok 4.20 Multi-Agent Betamedium Hunter AlphanonevsGrok 4.20 Multi-Agent Betamedium GPT-5.4 MinimediumvsGLM 5none Mercury 2mediumvsGLM 5none