नेव्हिगेशन
AI BENCHY
Advertise here

Grok 4.20 (medium) vs GLM 5.1 (medium)

average score जवळपास समान आहे: 7.0 vs 7.0. GLM 5.1 (medium) चा benchmark खर्च कमी आहे: $0.727 vs $0.805. Grok 4.20 (medium) वेगवान आहे: 32.56s vs 58.80s, pass rates 60.6% vs 65.2%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-15

क्रमांक
#120
एकूण आउटपुट टोकन्स
270,259
प्रतिसाद वेळ (सरासरी)
32.56s
एकूण खर्च
$0.805
क्रमांक
#117
एकूण आउटपुट टोकन्स
215,889
प्रतिसाद वेळ (सरासरी)
58.80s
एकूण खर्च
$0.727
शिफारस केलेले मॉडेल Grok 4.20 (medium)

It has the best score here (7.0), while responding about 1.8x faster than GLM 5.1 (medium).

तपशीलवार तुलना

मेट्रिक Grok 4.20 Grok 4.20 medium प्रकाशन: 2026-03-31 GLM 5.1 GLM 5.1 medium प्रकाशन: 2026-04-07
स्कोअर 7.0 7.0
क्रमांक #120 #117
विश्वसनीयता 10.0 8.1
सुसंगतता 8.2 8.4
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 60.6% 65.2%
अस्थिर चाचण्या 5 4
एकूण रन 66 66
प्रति निकाल खर्च 10.365 6.923
एकूण खर्च $0.805 $0.727
इनपुट किंमत $1.250 / 1M $0.966 / 1M
आउटपुट किंमत $2.500 / 1M $3.036 / 1M
एकूण इनपुट टोकन्स 102,986 82,592
आउटपुट टोकन्स 5,860 16,089
रिझनिंग टोकन्स 264,399 199,800
प्रतिसाद वेळ (सरासरी) 32.56s 58.80s
प्रतिसाद वेळ (कमाल) 199.66s 308.75s
प्रतिसाद वेळ (एकूण) 716.36s 1234.72s
पॅरामीटर्स ~1T एकूण (~100B सक्रिय) 744B एकूण (40B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#120 SpaceXAI: Grok 4.20

medium
खर्च
$0.041
वेळ
110.3s
टोकन्स
16,336 tok

#117 GLM 5.1

medium
अवैध SVG
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826

झटपट तुलना

तुलना जोडी बदला