नेविगेशन
Advertise here

Ember-1 (low) vs Mercury 2.5 Preview (medium)

average score लगभग बराबर है: 7.5 vs 7.5. Mercury 2.5 Preview (medium) की benchmark लागत कम है: $0.024 vs $0.662. Mercury 2.5 Preview (medium) तेज है: 3.58s vs 30.98s, pass rates 66.7% vs 69.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-28

तुलना किए गए मॉडल

रैंक
#120
कुल आउटपुट टोकन
37,467
प्रतिक्रिया समय (औसत)
30.98s
कुल लागत
$0.662
रैंक
#125
कुल आउटपुट टोकन
127,034
प्रतिक्रिया समय (औसत)
3.58s
कुल लागत
$0.024
अनुशंसित मॉडल Mercury 2.5 Preview (medium)

It has the best score here (7.5), while costing about 28.1x less than Ember-1 (low).

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 low रिलीज़: 2026-09-28 Mercury 2.5 Preview Mercury 2.5 Preview medium रिलीज़: 2026-09-02
स्कोर 7.5 7.5
रैंक #120 #125
विश्वसनीयता 8.1 10.0
संगति 8.5 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 66.7% 69.7%
अस्थिर टेस्ट 4 1
कुल रन 66 66
प्रति परिणाम लागत 5.085 0.158
कुल लागत $0.662 $0.024
इनपुट कीमत $3.000 / 1M $0.040 / 1M
आउटपुट कीमत $15.000 / 1M $0.150 / 1M
कुल इनपुट टोकन 33,011 112,713
आउटपुट टोकन 4,780 5,436
रीजनिंग टोकन 32,687 121,598
प्रतिक्रिया समय (औसत) 30.98s 3.58s
प्रतिक्रिया समय (अधिकतम) 93.10s 17.84s
प्रतिक्रिया समय (कुल) 681.50s 78.66s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~100B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#120 Ember-1

low
लागत
$0.016
समय
24.2s
टोकन
1,165 tok

#125 Mercury 2.5 Preview

medium
लागत
$0.001
समय
2.7s
टोकन
2,241 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 10.0 10.0 100.0% 0 37.91s 8,097 2,518 13,142
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126

त्वरित तुलना

तुलना जोड़ी बदलें