नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2.5 (medium) vs GLM 5.3 (low)

average score लगभग बराबर है: 6.8 vs 6.8. Mercury 2.5 (medium) की benchmark लागत कम है: $0.022 vs $0.257. Mercury 2.5 (medium) तेज है: 3.19s vs 13.65s, pass rates 65.2% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#157
कुल आउटपुट टोकन
120,129
प्रतिक्रिया समय (औसत)
3.19s
कुल लागत
$0.022
रैंक
#155
कुल आउटपुट टोकन
24,808
प्रतिक्रिया समय (औसत)
13.65s
कुल लागत
$0.257
अनुशंसित मॉडल Mercury 2.5 (medium)

It has the best score here (6.8), while costing about 11.8x less than GLM 5.3 (low).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 medium रिलीज़: 2026-09-08 GLM 5.3 GLM 5.3 low रिलीज़: 2026-08-20
स्कोर 6.8 6.8
रैंक #157 #155
विश्वसनीयता 9.8 10.0
संगति 8.6 8.5
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 65.2% 65.2%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 0.181 2.135
कुल लागत $0.022 $0.257
इनपुट कीमत $0.040 / 1M $1.400 / 1M
आउटपुट कीमत $0.150 / 1M $4.400 / 1M
कुल इनपुट टोकन 91,402 104,989
आउटपुट टोकन 3,138 8,532
रीजनिंग टोकन 116,991 16,276
प्रतिक्रिया समय (औसत) 3.19s 13.65s
प्रतिक्रिया समय (अधिकतम) 9.87s 83.60s
प्रतिक्रिया समय (कुल) 70.18s 300.22s
पैरामीटर ~100B 744B कुल (40B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#157 Mercury 2.5

medium
लागत
$0.001
समय
3.8s
टोकन
3,386 tok

#155 GLM 5.3

low
लागत
$0.007
समय
28.4s
टोकन
1,599 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 5.0 5.1 44.5% 2 3.70s 7,807 488 21,857
GLM 5.3 6.2 6.9 55.6% 1 21.02s 7,317 368 6,764

त्वरित तुलना

तुलना जोड़ी बदलें