नेविगेशन
Advertise here

Ember-1 (high) vs Mercury 2 (medium)

Ember-1 (high) average score में आगे है: 7.1 vs 7.0. Mercury 2 (medium) की benchmark लागत कम है: $0.094 vs $1.798. Mercury 2 (medium) तेज है: 2.95s vs 56.77s, pass rates 71.2% vs 53.0%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-28

तुलना किए गए मॉडल

रैंक
#158
कुल आउटपुट टोकन
110,125
प्रतिक्रिया समय (औसत)
56.77s
कुल लागत
$1.798
रैंक
#166
कुल आउटपुट टोकन
87,554
प्रतिक्रिया समय (औसत)
2.95s
कुल लागत
$0.094
अनुशंसित मॉडल Mercury 2 (medium)

Its score stays close to the best score here (7.0 vs 7.1), while costing about 19.3x less than Ember-1 (high).

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 high रिलीज़: 2026-09-28 Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24
स्कोर 7.1 7.0
रैंक #158 #166
विश्वसनीयता 8.0 10.0
संगति 7.3 8.4
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 71.2% 53.0%
अस्थिर टेस्ट 7 4
कुल रन 66 66
प्रति परिणाम लागत 14.981 0.933
कुल लागत $1.798 $0.094
इनपुट कीमत $3.000 / 1M $0.250 / 1M
आउटपुट कीमत $15.000 / 1M $0.750 / 1M
कुल इनपुट टोकन 48,577 110,515
आउटपुट टोकन 7,345 10,325
रीजनिंग टोकन 102,780 77,229
प्रतिक्रिया समय (औसत) 56.77s 2.95s
प्रतिक्रिया समय (अधिकतम) 255.06s 14.63s
प्रतिक्रिया समय (कुल) 1248.88s 61.89s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~100B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#158 Ember-1

high
लागत
$0.038
समय
55.1s
टोकन
2,671 tok

#166 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 8.2 7.2 88.9% 1 72.23s 7,144 1,281 23,093
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328

त्वरित तुलना

तुलना जोड़ी बदलें