नेविगेशन
Advertise here

Mercury 2.5 Preview (high) vs GLM 5.1

average score लगभग बराबर है: 6.5 vs 6.5. Mercury 2.5 Preview (high) की benchmark लागत कम है: $0.039 vs $0.311. Mercury 2.5 Preview (high) तेज है: 7.61s vs 11.10s, pass rates 65.2% vs 47.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#193
कुल आउटपुट टोकन
180,597
प्रतिक्रिया समय (औसत)
7.61s
कुल लागत
$0.039
रैंक
#196
कुल आउटपुट टोकन
20,076
प्रतिक्रिया समय (औसत)
11.10s
कुल लागत
$0.311
अनुशंसित मॉडल Mercury 2.5 Preview (high)

It has the best score here (6.5), while costing about 8.1x less than GLM 5.1.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview high रिलीज़: 2026-09-02 GLM 5.1 GLM 5.1 none रिलीज़: 2026-04-07
स्कोर 6.5 6.5
रैंक #193 #196
विश्वसनीयता 9.9 10.0
संगति 8.0 8.2
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 65.2% 47.8%
अस्थिर टेस्ट 6 5
कुल रन 69 69
प्रति परिणाम लागत 0.319 3.478
कुल लागत $0.039 $0.311
इनपुट कीमत $0.000 / 1M $0.965 / 1M
आउटपुट कीमत $0.000 / 1M $3.032 / 1M
कुल इनपुट टोकन 298,512 258,956
आउटपुट टोकन 3,178 20,076
रीजनिंग टोकन 177,419 0
प्रतिक्रिया समय (औसत) 7.61s 11.10s
प्रतिक्रिया समय (अधिकतम) 86.84s 107.19s
प्रतिक्रिया समय (कुल) 175.08s 255.39s
पैरामीटर ~100B 744B कुल (40B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#193 Mercury 2.5 Preview

high
लागत
$0.001
समय
4.5s
टोकन
3,851 tok

#196 GLM 5.1

none
Reached the allocated time limit (300 seconds) without receiving showcase output.
लागत
$0.000
समय
300.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 6.7 7.8 55.6% 1 6.13s 7,751 485 42,569
GLM 5.1 3.9 9.7 0.0% 0 4.96s 7,256 525 0

त्वरित तुलना

तुलना जोड़ी बदलें