AI BENCHY
Advertise here
#18

GLM 5

Z.ai प्रकाशन: 2026-02-12 चाचणी तारीख: 2026-05-21 23:44 z-ai/glm-5::medium
744B एकूण (40B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

GLM 5 AI BENCHY वर 8.2 स्कोर करते आणि #18 वर आहे. याची reliability 10.0, pass rate 81.7%, एकूण खर्च $0.237, आणि सरासरी response time 33.39s आहे.

GLM 5 खास का आहे: या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
744B एकूण (40B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

8.4

एकूण आउटपुट टोकन्स

119,898

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.600 / 1M

आउटपुट किंमत

$1.920 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 6

प्रति प्रयत्न पास दर: 81.7%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

33.39s

प्रतिसाद वेळ (कमाल): 99.85s

प्रतिसाद वेळ (एकूण): 400.62s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#18 GLM 5

medium
खर्च
$0.005
वेळ
20.7s
टोकन्स
2,068 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-06-04 13:07 पुन्हा चाचणी 7.7 10.0 $0.307 तुलना करा
2026-06-04 13:07 पुन्हा चाचणी 7.7 10.0 $0.372 तुलना करा
2026-06-04 13:07 नवीन चाचणी जोडली 8.3 10.0 $0.228 तुलना करा
2026-05-21 23:44 पुन्हा चाचणी 8.2 10.0 $0.237 सध्याची रन
2026-04-22 12:55 पहिली नोंदलेली रन 8.4 लागू नाही $0.155 तुलना करा

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-21 23:44 · पुन्हा चाचणी60/60 प्रयत्न8.28.410.014/204119,8980$0.23733.39s
2026-06-04 13:07 · पुन्हा चाचणी63/63 प्रयत्न7.78.110.015/214124,56635,224$0.30733.54s
फरक+0.5+0.30.0-10-4668-35224-$0.071-152ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 10.0 10.0
कोडिंग 10.0 10.0
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 7.1 5.6
डोमेन-विशिष्ट 3.5 4.4
Samanya Buddhimatta 6.1 3.1
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 10.0 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स