نیویگیشن
AI BENCHY
Advertise here

Grok 4.20 (medium) vs GLM 5.1 (medium)

average score تقریباً برابر ہے: 7.0 vs 7.0. GLM 5.1 (medium) کی benchmark لاگت کم ہے: $0.727 vs $0.805. Grok 4.20 (medium) تیز ہے: 32.56s vs 58.80s، pass rates 60.6% vs 65.2%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-08-15

درجہ
#120
کل آؤٹ پٹ ٹوکنز
270,259
ردِعمل کا وقت (اوسط)
32.56s
کل لاگت
$0.805
درجہ
#117
کل آؤٹ پٹ ٹوکنز
215,889
ردِعمل کا وقت (اوسط)
58.80s
کل لاگت
$0.727
تجویز کردہ ماڈل Grok 4.20 (medium)

It has the best score here (7.0), while responding about 1.8x faster than GLM 5.1 (medium).

تفصیلی موازنہ

میٹرک Grok 4.20 Grok 4.20 medium اجرا: 2026-03-31 GLM 5.1 GLM 5.1 medium اجرا: 2026-04-07
اسکور 7.0 7.0
درجہ #120 #117
اعتماد پذیری 10.0 8.1
تسلسل 8.2 8.4
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 60.6% 65.2%
غیر مستحکم ٹیسٹ 5 4
کل رنز 66 66
فی نتیجہ لاگت 10.365 6.923
کل لاگت $0.805 $0.727
ان پٹ قیمت $1.250 / 1M $0.966 / 1M
آؤٹ پٹ قیمت $2.500 / 1M $3.036 / 1M
کل ان پٹ ٹوکنز 102,986 82,592
آؤٹ پٹ ٹوکنز 5,860 16,089
ریزننگ ٹوکنز 264,399 199,800
ردِعمل کا وقت (اوسط) 32.56s 58.80s
ردِعمل کا وقت (زیادہ سے زیادہ) 199.66s 308.75s
ردِعمل کا وقت (کل) 716.36s 1234.72s
پیرامیٹرز ~1T کل (~100B فعال) 744B کل (40B فعال)
دستیابی بند ماخذ کھلا ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#120 SpaceXAI: Grok 4.20

medium
لاگت
$0.041
وقت
110.3s
ٹوکنز
16,336 tok

#117 GLM 5.1

medium
غلط SVG
لاگت
$0.000
وقت
300.0s
ٹوکنز
0 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں