AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#102

GLM 4.7 Flash

Z.ai प्रकाशन: 2026-01-19 चाचणी तारीख: 2026-04-11 01:19 z-ai/glm-4.7-flash::medium
30B एकूण (3B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

GLM 4.7 Flash AI BENCHY वर 4.6 स्कोर करते आणि #102 वर आहे. याची reliability लागू नाही, pass rate 38.9%, एकूण खर्च $0.046, आणि सरासरी response time 32.33s आहे.

GLM 4.7 Flash खास का आहे: या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
30B एकूण (3B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

6.3

विश्वसनीयता

लागू नाही

एकूण आउटपुट टोकन्स

112,089

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.060 / 1M

आउटपुट किंमत

$0.400 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 14

प्रति प्रयत्न पास दर: 38.9%

अस्थिर चाचण्या

8

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

32.33s

प्रतिसाद वेळ (कमाल): 174.55s

प्रतिसाद वेळ (एकूण): 355.65s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#102 GLM 4.7 Flash

medium
अवैध SVG
खर्च
$0.000
वेळ
186.2s
टोकन्स
12,112 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 01:33 पुन्हा चाचणी 4.3 8.6 $0.168 तुलना करा
2026-07-16 22:32 नवीन चाचणी जोडली 4.3 7.8 $0.166 तुलना करा
2026-06-04 13:29 नवीन चाचणी जोडली 4.4 6.7 $0.054 तुलना करा
2026-05-21 23:50 सूट बदलला 4.5 8.3 $0.054 तुलना करा
2026-04-11 01:19 पहिली नोंदलेली रन 4.6 लागू नाही $0.046 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-04-11 01:19 · पहिली नोंदलेली रन54/54 प्रयत्न4.66.3लागू नाही4/188112,0890$0.04632.33s
2026-05-21 23:50 · सूट बदलला60/60 प्रयत्न4.56.78.34/208132,8200$0.05435.09s
फरक+0.1-0.400-207310-$0.009-2759ms

बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 4.7 5.9
कोडिंग 3.6 2.1
संयुक्त 2.8 2.1
डेटा पार्सिंग आणि निष्कर्षण 6.3 10.0
डोमेन-विशिष्ट 3.5 4.4
Samanya Buddhimatta 3.6 9.7
सूचनांचे पालन 6.2 5.8
कोडी सोडवणे 2.9 7.2
टूल कॉलिंग 10.0 10.0

तुलना केलेली मॉडेल्स