AI BENCHY
Advertise here
#60

GLM 5V Turbo

Z.ai प्रकाशन: 2026-04-01 चाचणी तारीख: 2026-05-21 23:44 z-ai/glm-5v-turbo::medium
~106B एकूण (~12B सक्रिय)MoEबंद स्रोतअंदाजित
(medium) (none)

सारांश

GLM 5V Turbo AI BENCHY वर 7.4 स्कोर करते आणि #60 वर आहे. याची reliability 10.0, pass rate 70.0%, एकूण खर्च $0.412, आणि सरासरी response time 20.31s आहे.

संग्रहित मॉडेल: हे मॉडेल आता अपडेट केले जाणार नाही आणि नवीन चाचण्यांवर तपासले जाणार नाही.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

अंदाजित
पॅरामीटर्स
~106B एकूण (~12B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
परवाना
-

सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.

सुसंगतता

7.8

एकूण आउटपुट टोकन्स

90,342

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$1.200 / 1M

आउटपुट किंमत

$4.000 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 9

प्रति प्रयत्न पास दर: 70.0%

अस्थिर चाचण्या

6

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

20.31s

प्रतिसाद वेळ (कमाल): 95.88s

प्रतिसाद वेळ (एकूण): 406.16s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 GLM 5V Turbo

medium
अवैध SVG
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-06-04 13:09 पुन्हा चाचणी 6.7 10.0 $0.457 तुलना करा
2026-06-04 13:09 पुन्हा चाचणी 6.7 10.0 $0.457 तुलना करा
2026-06-04 13:09 नवीन चाचणी जोडली 7.2 10.0 $0.457 तुलना करा
2026-05-21 23:44 सूट बदलला 7.4 10.0 $0.412 सध्याची रन
2026-04-11 01:19 पहिली नोंदलेली रन 7.8 लागू नाही $0.291 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-21 23:44 · सूट बदलला60/60 प्रयत्न7.47.810.011/20690,3420$0.41220.31s
2026-06-04 13:09 · नवीन चाचणी जोडली63/63 प्रयत्न7.27.910.011/216100,76244,615$0.45723.08s
फरक+0.1-0.10.000-10420-44615-$0.045-2770ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 7.2 6.1
कोडिंग 6.8 10.0
संयुक्त 6.9 3.8
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 10.0 10.0
सूचनांचे पालन 9.9 10.0
कोडी सोडवणे 7.6 7.2
टूल कॉलिंग 7.0 3.7
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स