नेविगेशन
AI BENCHY
Advertise here

Mercury 2 (medium) vs GLM 5.1 (medium)

average score लगभग बराबर है: 7.0 vs 7.0. Mercury 2 (medium) की benchmark लागत कम है: $0.094 vs $0.727. Mercury 2 (medium) तेज है: 2.95s vs 58.80s, pass rates 53.0% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#131
कुल आउटपुट टोकन
87,554
प्रतिक्रिया समय (औसत)
2.95s
कुल लागत
$0.094
रैंक
#129
कुल आउटपुट टोकन
215,889
प्रतिक्रिया समय (औसत)
58.80s
कुल लागत
$0.727
अनुशंसित मॉडल Mercury 2 (medium)

It has the best score here (7.0), while costing about 7.8x less than GLM 5.1 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 GLM 5.1 GLM 5.1 medium रिलीज़: 2026-04-07
स्कोर 7.0 7.0
रैंक #131 #129
विश्वसनीयता 10.0 8.1
संगति 8.4 8.4
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 53.0% 65.2%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 0.933 6.923
कुल लागत $0.094 $0.727
इनपुट कीमत $0.250 / 1M $0.966 / 1M
आउटपुट कीमत $0.750 / 1M $3.036 / 1M
कुल इनपुट टोकन 110,515 82,592
आउटपुट टोकन 10,325 16,089
रीजनिंग टोकन 77,229 199,800
प्रतिक्रिया समय (औसत) 2.95s 58.80s
प्रतिक्रिया समय (अधिकतम) 14.63s 308.75s
प्रतिक्रिया समय (कुल) 61.89s 1234.72s
पैरामीटर ~100B 744B कुल (40B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#131 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#129 GLM 5.1

medium
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826

त्वरित तुलना

तुलना जोड़ी बदलें