नेव्हिगेशन
Advertise here

Ember-1 vs Mercury 2.5 (low)

Ember-1 average score मध्ये पुढे आहे: 5.2 vs 5.1. Mercury 2.5 (low) चा benchmark खर्च कमी आहे: $0.011 vs $0.123. Mercury 2.5 (low) वेगवान आहे: 1.35s vs 19.46s, pass rates 42.4% vs 39.4%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-28

तुलना केलेली मॉडेल्स

क्रमांक
#297
एकूण आउटपुट टोकन्स
2,664
प्रतिसाद वेळ (सरासरी)
19.46s
एकूण खर्च
$0.123
क्रमांक
#304
एकूण आउटपुट टोकन्स
33,719
प्रतिसाद वेळ (सरासरी)
1.35s
एकूण खर्च
$0.011
शिफारस केलेले मॉडेल Mercury 2.5 (low)

Its score stays close to the best score here (5.1 vs 5.2), while costing about 11.6x less than Ember-1.

तपशीलवार तुलना

मेट्रिक Ember-1 Ember-1 none प्रकाशन: 2026-09-28 Mercury 2.5 Mercury 2.5 low प्रकाशन: 2026-09-08
स्कोअर 5.2 5.1
क्रमांक #297 #304
विश्वसनीयता 8.1 9.8
सुसंगतता 8.9 8.1
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 42.4% 39.4%
अस्थिर चाचण्या 3 5
एकूण रन 66 66
प्रति निकाल खर्च 1.528 0.177
एकूण खर्च $0.123 $0.011
इनपुट किंमत $3.000 / 1M $0.040 / 1M
आउटपुट किंमत $15.000 / 1M $0.150 / 1M
एकूण इनपुट टोकन्स 27,426 138,020
आउटपुट टोकन्स 2,664 6,083
रिझनिंग टोकन्स 0 27,636
प्रतिसाद वेळ (सरासरी) 19.46s 1.35s
प्रतिसाद वेळ (कमाल) 93.12s 7.48s
प्रतिसाद वेळ (एकूण) 428.04s 29.74s
पॅरामीटर्स ~2.8T एकूण (~104B सक्रिय) ~100B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#297 Ember-1

none
खर्च
$0.156
वेळ
224.6s
टोकन्स
10,555 tok

#304 Mercury 2.5

low
खर्च
$0.001
वेळ
2.4s
टोकन्स
1,236 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Ember-1 5.5 10.0 33.3% 0 1.94s 7,485 393 0
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269

झटपट तुलना

तुलना जोडी बदला