AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#114

GLM 5.1

Z.ai प्रकाशन: 2026-04-07 चाचणी तारीख: 2026-05-21 23:41 z-ai/glm-5.1::none
744B एकूण (40B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

GLM 5.1 AI BENCHY वर 5.6 स्कोर करते आणि #114 वर आहे. याची reliability 10.0, pass rate 40.0%, एकूण खर्च $0.057, आणि सरासरी response time 4.16s आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
744B एकूण (40B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

8.1

एकूण आउटपुट टोकन्स

3,749

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.980 / 1M

आउटपुट किंमत

$3.080 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 14

प्रति प्रयत्न पास दर: 40.0%

अस्थिर चाचण्या

5

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

4.16s

प्रतिसाद वेळ (कमाल): 32.57s

प्रतिसाद वेळ (एकूण): 83.23s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#114 GLM 5.1

none
अवैध SVG
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 01:32 पुन्हा चाचणी 5.7 10.0 $0.238 तुलना करा
2026-07-16 21:16 नवीन चाचणी जोडली 5.5 10.0 $0.164 तुलना करा
2026-06-04 13:04 नवीन चाचणी जोडली 5.7 10.0 $0.058 तुलना करा
2026-05-21 23:41 सूट बदलला 5.6 10.0 $0.057 सध्याची रन
2026-05-08 13:04 सूट बदलला 5.7 10.0 $0.053 तुलना करा
2026-05-08 13:04 सूट बदलला 5.7 10.0 $0.053 तुलना करा
2026-04-22 12:55 पहिली नोंदलेली रन 5.6 लागू नाही $0.053 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-21 23:41 · सूट बदलला60/60 प्रयत्न5.68.110.06/2053,7490$0.0574.16s
2026-05-08 13:04 · सूट बदलला57/57 प्रयत्न5.78.010.06/1953,7310$0.0534.23s
फरक-0.1+0.10.000+180+$0.004-68ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 57/57 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 4.0 6.3
कोडिंग 4.3 9.5
संयुक्त 2.8 2.1
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 2.9 7.2
Samanya Buddhimatta 5.0 10.0
सूचनांचे पालन 9.8 10.0
कोडी सोडवणे 6.1 7.8
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स