नेविगेशन
Advertise here

Ember-1 vs Mercury 2.5 (low)

Ember-1 average score में आगे है: 5.2 vs 5.1. Mercury 2.5 (low) की benchmark लागत कम है: $0.011 vs $0.123. Mercury 2.5 (low) तेज है: 1.35s vs 19.46s, pass rates 42.4% vs 39.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-28

तुलना किए गए मॉडल

रैंक
#297
कुल आउटपुट टोकन
2,664
प्रतिक्रिया समय (औसत)
19.46s
कुल लागत
$0.123
रैंक
#304
कुल आउटपुट टोकन
33,719
प्रतिक्रिया समय (औसत)
1.35s
कुल लागत
$0.011
अनुशंसित मॉडल Mercury 2.5 (low)

Its score stays close to the best score here (5.1 vs 5.2), while costing about 11.6x less than Ember-1.

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 none रिलीज़: 2026-09-28 Mercury 2.5 Mercury 2.5 low रिलीज़: 2026-09-08
स्कोर 5.2 5.1
रैंक #297 #304
विश्वसनीयता 8.1 9.8
संगति 8.9 8.1
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 42.4% 39.4%
अस्थिर टेस्ट 3 5
कुल रन 66 66
प्रति परिणाम लागत 1.528 0.177
कुल लागत $0.123 $0.011
इनपुट कीमत $3.000 / 1M $0.040 / 1M
आउटपुट कीमत $15.000 / 1M $0.150 / 1M
कुल इनपुट टोकन 27,426 138,020
आउटपुट टोकन 2,664 6,083
रीजनिंग टोकन 0 27,636
प्रतिक्रिया समय (औसत) 19.46s 1.35s
प्रतिक्रिया समय (अधिकतम) 93.12s 7.48s
प्रतिक्रिया समय (कुल) 428.04s 29.74s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~100B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#297 Ember-1

none
लागत
$0.156
समय
224.6s
टोकन
10,555 tok

#304 Mercury 2.5

low
लागत
$0.001
समय
2.4s
टोकन
1,236 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 5.5 10.0 33.3% 0 1.94s 7,485 393 0
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269

त्वरित तुलना

तुलना जोड़ी बदलें