नेविगेशन
Advertise here

Mercury 2.5 (high) vs GLM 5.1 (medium)

Mercury 2.5 (high) average score में आगे है: 7.1 vs 7.0. Mercury 2.5 (high) की benchmark लागत कम है: $0.031 vs $0.727. Mercury 2.5 (high) तेज है: 4.32s vs 58.80s, pass rates 62.1% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#134
कुल आउटपुट टोकन
174,547
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.031
रैंक
#138
कुल आउटपुट टोकन
215,889
प्रतिक्रिया समय (औसत)
58.80s
कुल लागत
$0.727
अनुशंसित मॉडल Mercury 2.5 (high)

It has the best score here (7.1), while costing about 23.4x less than GLM 5.1 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08 GLM 5.1 GLM 5.1 medium रिलीज़: 2026-04-07
स्कोर 7.1 7.0
रैंक #134 #138
विश्वसनीयता 9.7 8.1
संगति 8.6 8.4
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 62.1% 65.2%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 0.259 6.923
कुल लागत $0.031 $0.727
इनपुट कीमत $0.040 / 1M $0.966 / 1M
आउटपुट कीमत $0.150 / 1M $3.036 / 1M
कुल इनपुट टोकन 120,068 82,592
आउटपुट टोकन 3,402 16,089
रीजनिंग टोकन 171,145 199,800
प्रतिक्रिया समय (औसत) 4.32s 58.80s
प्रतिक्रिया समय (अधिकतम) 23.63s 308.75s
प्रतिक्रिया समय (कुल) 95.06s 1234.72s
पैरामीटर ~100B 744B कुल (40B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#134 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

#138 GLM 5.1

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
लागत
$0.000
समय
300.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826

त्वरित तुलना

तुलना जोड़ी बदलें