नेविगेशन
Advertise here

Ember-1 (high) vs Mercury 2.5 Preview (medium)

Ember-1 (high) average score में आगे है: 6.9 vs 6.8. Mercury 2.5 Preview (medium) की benchmark लागत कम है: $0.037 vs $2.405. Mercury 2.5 Preview (medium) तेज है: 6.66s vs 58.14s, pass rates 71.0% vs 66.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#163
कुल आउटपुट टोकन
121,223
प्रतिक्रिया समय (औसत)
58.14s
कुल लागत
$2.405
रैंक
#171
कुल आउटपुट टोकन
150,107
प्रतिक्रिया समय (औसत)
6.66s
कुल लागत
$0.037
अनुशंसित मॉडल Mercury 2.5 Preview (medium)

Its score stays close to the best score here (6.8 vs 6.9), while costing about 65.8x less than Ember-1 (high).

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 high रिलीज़: 2026-09-28 Mercury 2.5 Preview Mercury 2.5 Preview medium रिलीज़: 2026-09-02
स्कोर 6.9 6.8
रैंक #163 #171
विश्वसनीयता 8.6 10.0
संगति 7.2 9.6
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 71.0% 66.7%
अस्थिर टेस्ट 8 1
कुल रन 69 69
प्रति परिणाम लागत 20.041 0.244
कुल लागत $2.405 $0.037
इनपुट कीमत $3.000 / 1M $0.000 / 1M
आउटपुट कीमत $15.000 / 1M $0.000 / 1M
कुल इनपुट टोकन 195,489 397,291
आउटपुट टोकन 12,475 6,355
रीजनिंग टोकन 108,748 143,752
प्रतिक्रिया समय (औसत) 58.14s 6.66s
प्रतिक्रिया समय (अधिकतम) 255.06s 74.63s
प्रतिक्रिया समय (कुल) 1337.19s 153.29s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~100B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#163 Ember-1

high
लागत
$0.038
समय
55.1s
टोकन
2,671 tok

#171 Mercury 2.5 Preview

medium
लागत
$0.001
समय
2.7s
टोकन
2,241 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 8.2 7.2 88.9% 1 72.23s 7,144 1,281 23,093
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126

त्वरित तुलना

तुलना जोड़ी बदलें