AI BENCHY
Advertise here
#185

GLM 4.7 Flash

Z.ai रिलीज़: 2026-01-19 परीक्षण किया गया: 2026-07-16 22:32 z-ai/glm-4.7-flash::medium
30B कुल (3B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

GLM 4.7 Flash AI BENCHY पर 4.3 स्कोर करता है और #185 पर है। इसकी reliability 7.8, pass rate 31.8%, कुल लागत $0.166, और औसत response time 142.59s है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
30B कुल (3B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
MIT

संगति

7.0

कुल आउटपुट टोकन

417,863

कुल इनपुट टोकन

79,051

इनपुट कीमत

$0.061 / 1M

आउटपुट कीमत

$0.400 / 1M

सही परीक्षण

गलत टेस्ट: 18

प्रति प्रयास पास दर: 31.8%

अस्थिर टेस्ट

8

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

142.59s

प्रतिक्रिया समय (अधिकतम): 1539.97s

प्रतिक्रिया समय (कुल): 1996.21s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#185 GLM 4.7 Flash

medium
अमान्य SVG
लागत
$0.000
समय
186.2s
टोकन
12,112 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 01:33 दोबारा परीक्षण 4.3 8.6 $0.168 तुलना करें
2026-07-16 22:32 नया टेस्ट जोड़ा गया 4.3 7.8 $0.166 वर्तमान रन
2026-06-04 13:29 नया टेस्ट जोड़ा गया 4.4 6.7 $0.054 तुलना करें
2026-05-21 23:50 सूट बदला गया 4.5 8.3 $0.054 तुलना करें
2026-04-11 01:19 पहला दर्ज रन 4.6 लागू नहीं $0.046 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-06-04 15:40 $0.060 / 1M $0.400 / 1M
2026-07-16 15:36 $0.061 / 1M $0.400 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 4.7 5.9
कोडिंग 3.2 7.4
संयुक्त 2.9 6.0
डेटा पार्सिंग और निष्कर्षण 6.3 10.0
डोमेन-विशिष्ट 3.5 4.4
Samanya Buddhimatta 3.6 9.7
निर्देश पालन 6.2 5.8
पहेली समाधान 2.9 7.2
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल