नेविगेशन
Advertise here

Mercury 2.5 (high) vs Muse Glimmer 30B (medium)

Muse Glimmer 30B (medium) average score में आगे है: 7.2 vs 7.1. Mercury 2.5 (high) की benchmark लागत कम है: $0.031 vs $0.211. Mercury 2.5 (high) तेज है: 4.32s vs 30.64s, pass rates 62.1% vs 63.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#134
कुल आउटपुट टोकन
174,547
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.031
रैंक
#129
कुल आउटपुट टोकन
168,074
प्रतिक्रिया समय (औसत)
30.64s
कुल लागत
$0.211
अनुशंसित मॉडल Mercury 2.5 (high)

Its score stays close to the best score here (7.1 vs 7.2), while costing about 6.8x less than Muse Glimmer 30B (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08 Muse Glimmer 30B Muse Glimmer 30B medium रिलीज़: 2026-08-11
स्कोर 7.1 7.2
रैंक #134 #129
विश्वसनीयता 9.7 10.0
संगति 8.6 7.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 62.1% 63.6%
अस्थिर टेस्ट 4 6
कुल रन 66 66
प्रति परिणाम लागत 0.259 2.543
कुल लागत $0.031 $0.211
इनपुट कीमत $0.040 / 1M $0.300 / 1M
आउटपुट कीमत $0.150 / 1M $1.100 / 1M
कुल इनपुट टोकन 120,068 116,513
आउटपुट टोकन 3,402 33,065
रीजनिंग टोकन 171,145 135,009
प्रतिक्रिया समय (औसत) 4.32s 30.64s
प्रतिक्रिया समय (अधिकतम) 23.63s 181.08s
प्रतिक्रिया समय (कुल) 95.06s 674.01s
पैरामीटर ~100B 30B
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#134 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

#129 Muse Glimmer 30B

medium
लागत
$0.003
समय
31.9s
टोकन
1,845 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
Muse Glimmer 30B 8.4 7.8 77.8% 1 33.67s 7,419 4,662 20,605

त्वरित तुलना

तुलना जोड़ी बदलें