AI BENCHY
Advertise here
#133

GLM 5

Z.ai रिलीज़: 2026-02-12 परीक्षण किया गया: 2026-06-04 13:05 z-ai/glm-5::none
744B कुल (40B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

GLM 5 AI BENCHY पर 5.7 स्कोर करता है और #133 पर है। इसकी reliability 10.0, pass rate 42.4%, कुल लागत $0.042, और औसत response time 4.03s है।

GLM 5 को अलग क्या बनाता है: यह Samanya Buddhimatta में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि संयुक्त इसकी सबसे कमजोर जगह है, जहाँ यह #17 पर है। इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
744B कुल (40B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
MIT

संगति

9.3

कुल लागत (वर्तमान कीमत)

$0.042 ↑ +75.9%

परीक्षण के समय: $0.024

कुल आउटपुट टोकन

1,989

कुल इनपुट टोकन

37,135

इनपुट कीमत

$0.950 / 1M

आउटपुट कीमत

$3.150 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 42.4%

अस्थिर टेस्ट

1

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

4.03s

प्रतिक्रिया समय (अधिकतम): 11.07s

प्रतिक्रिया समय (कुल): 56.37s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#133 GLM 5

none
लागत
$0.007
समय
32.1s
टोकन
2,023 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-06-04 13:05 दोबारा परीक्षण 5.7 10.0 $0.041 तुलना करें
2026-06-04 13:05 दोबारा परीक्षण 5.7 10.0 $0.042 वर्तमान रन
2026-06-04 13:05 नया टेस्ट जोड़ा गया 6.1 10.0 $0.027 तुलना करें
2026-05-21 23:41 सूट बदला गया 6.3 10.0 $0.023 तुलना करें
2026-04-22 12:55 पहला दर्ज रन 6.6 लागू नहीं $0.020 तुलना करें

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-06-04 13:05 · दोबारा परीक्षण63/63 प्रयास5.79.310.09/2111,98937,135$0.0424.03s
2026-05-21 23:41 · सूट बदला गया60/60 प्रयास6.39.710.09/2011,9880$0.0233.97s
अंतर-0.6-0.40.000+1+37135+$0.020+53ms

बेंचमार्क कवरेज अलग है: 63/63 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 60/60 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-06-04 15:40 $0.600 / 1M $1.920 / 1M
2026-07-16 15:36 $0.950 / 1M $3.150 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 4.8 10.0
कोडिंग 4.0 7.8
संयुक्त 1.5 5.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 3.0 10.0
Samanya Buddhimatta 10.0 10.0
निर्देश पालन 10.0 10.0
पहेली समाधान 7.7 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल