नेविगेशन
AI BENCHY
Advertise here

Mercury 2 (medium) vs Muse Glimmer 30B (low)

Muse Glimmer 30B (low) average score में आगे है: 7.1 vs 7.0. Mercury 2 (medium) की benchmark लागत कम है: $0.093 vs $0.186. Mercury 2 (medium) तेज है: 2.72s vs 18.51s, pass rates 51.5% vs 63.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-11

रैंक
#104
कुल आउटपुट टोकन
87,119
प्रतिक्रिया समय (औसत)
2.72s
कुल लागत
$0.093
रैंक
#99
कुल आउटपुट टोकन
95,478
प्रतिक्रिया समय (औसत)
18.51s
कुल लागत
$0.186
अनुशंसित मॉडल Mercury 2 (medium)

Its score stays close to the best score here (7.0 vs 7.1), while costing about 2.0x less than Muse Glimmer 30B (low).

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 Muse Glimmer 30B Muse Glimmer 30B low रिलीज़: 2026-08-11
स्कोर 7.0 7.1
रैंक #104 #99
विश्वसनीयता 10.0 10.0
संगति 8.8 8.2
बेंचमार्क कवरेज 22/22 टेस्ट · 66/66 प्रयास 22/22 टेस्ट · 66/66 प्रयास
सही परीक्षण
प्रति प्रयास पास दर 51.5% 63.6%
अस्थिर टेस्ट 3 5
कुल रन 66 66
प्रति परिणाम लागत 0.928 1.685
कुल लागत $0.093 $0.186
इनपुट कीमत $0.250 / 1M $0.350 / 1M
आउटपुट कीमत $0.750 / 1M $1.500 / 1M
कुल इनपुट टोकन 109,572 130,300
आउटपुट टोकन 10,313 33,907
रीजनिंग टोकन 76,806 61,571
प्रतिक्रिया समय (औसत) 2.72s 18.51s
प्रतिक्रिया समय (अधिकतम) 14.63s 234.92s
प्रतिक्रिया समय (कुल) 57.12s 407.22s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#99 Muse Glimmer 30B

low
लागत
$0.002
समय
13.5s
टोकन
953 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Muse Glimmer 30B 8.1 9.9 66.7% 0 16.52s 7,419 2,759 10,173

त्वरित तुलना

तुलना जोड़ी बदलें