Navigation
Advertise here

Grok 4.3 (medium) vs GLM 5.1 (medium)

Le score moyen est pratiquement à égalité avec 7.0 vs 7.0. GLM 5.1 (medium) a le coût de benchmark le plus bas avec $0.727 vs $0.741. Grok 4.3 (medium) est plus rapide avec 44.21s vs 58.80s, avec des taux de réussite de 66.7% vs 65.2%.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-09-10

Modèles comparés

Rang
#139
Total des jetons de sortie
225,904
Temps de réponse (moy.)
44.21s
Coût total
$0.741
Rang
#142
Total des jetons de sortie
215,889
Temps de réponse (moy.)
58.80s
Coût total
$0.727
Modèle recommandé Grok 4.3 (medium)

Il obtient le meilleur score de cette comparaison (7.0) et le meilleur équilibre global entre coût et temps de réponse sur les 2 modèles.

Comparaison détaillée

Métrique Grok 4.3 Grok 4.3 medium Sortie: 2026-05-01 GLM 5.1 GLM 5.1 medium Sortie: 2026-04-07
Score 7.0 7.0
Rang #139 #142
Fiabilité 10.0 8.1
Cohérence 8.2 8.4
Tentatives 66/66 66/66
Tests corrects
Taux de réussite par tentative 66.7% 65.2%
Tests instables 5 4
Exécutions totales 66 66
Coût par résultat 6.168 6.923
Coût total $0.741 $0.727
Prix d'entrée $1.250 / 1M $0.966 / 1M
Prix de sortie $2.500 / 1M $3.036 / 1M
Total des jetons d'entrée 140,244 82,592
Jetons de sortie 13,739 16,089
Jetons de raisonnement 212,165 199,800
Temps de réponse (moy.) 44.21s 58.80s
Temps de réponse (max) 216.69s 308.75s
Temps de réponse (total) 972.64s 1234.72s
Paramètres ~1.5T au total (~150B actifs) 744B au total (40B actifs)
Disponibilité Source fermée Open source

Génération showcase de modèles

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#139 SpaceXAI: Grok 4.3

medium
Coût
$0.009
Temps
19.0s
Tokens
3,661 tok

#142 GLM 5.1

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Coût
$0.000
Temps
300.0s
Tokens
0 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Programmation Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons d'entrée Jetons de sortie Jetons de raisonnement
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826

Comparaison rapide

Changer la paire de comparaison