AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#133

GLM 5

Z.ai रिलीज़: 2026-02-12 परीक्षण किया गया: 2026-06-04 13:05 z-ai/glm-5::none
744B कुल (40B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

GLM 5 AI BENCHY पर 5.7 स्कोर करता है और #133 पर है। इसकी reliability 10.0, pass rate 42.4%, कुल लागत $0.042, और औसत response time 4.03s है।

GLM 5 को अलग क्या बनाता है: यह Samanya Buddhimatta में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि संयुक्त इसकी सबसे कमजोर जगह है, जहाँ यह #17 पर है। इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
744B कुल (40B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
MIT

संगति

9.3

कुल लागत (वर्तमान कीमत)

$0.042 ↑ +75.9%

परीक्षण के समय: $0.024

कुल आउटपुट टोकन

1,989

कुल इनपुट टोकन

37,135

इनपुट कीमत

$0.950 / 1M

आउटपुट कीमत

$3.150 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 42.4%

अस्थिर टेस्ट

1

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

4.03s

प्रतिक्रिया समय (अधिकतम): 11.07s

प्रतिक्रिया समय (कुल): 56.37s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#133 GLM 5

none
लागत
$0.007
समय
32.1s
टोकन
2,023 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-06-04 13:05 दोबारा परीक्षण 5.7 10.0 $0.041 तुलना करें
2026-06-04 13:05 दोबारा परीक्षण 5.7 10.0 $0.042 वर्तमान रन
2026-06-04 13:05 नया टेस्ट जोड़ा गया 6.1 10.0 $0.027 तुलना करें
2026-05-21 23:41 सूट बदला गया 6.3 10.0 $0.023 तुलना करें
2026-04-22 12:55 पहला दर्ज रन 6.6 लागू नहीं $0.020 तुलना करें

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-06-04 13:05 · दोबारा परीक्षण63/63 प्रयास5.79.310.09/2111,98937,135$0.0424.03s
2026-04-22 12:55 · पहला दर्ज रन54/54 प्रयास6.69.6लागू नहीं9/1811,9590$0.0204.23s
अंतर-0.9-0.300+30+37135+$0.023-202ms

बेंचमार्क कवरेज अलग है: 63/63 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 54/54 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-06-04 15:40 $0.600 / 1M $1.920 / 1M
2026-07-16 15:36 $0.950 / 1M $3.150 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 4.8 10.0
कोडिंग 4.0 7.8
संयुक्त 1.5 5.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 3.0 10.0
Samanya Buddhimatta 10.0 10.0
निर्देश पालन 10.0 10.0
पहेली समाधान 7.7 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल